Mô hìnhNghiên cứu 🇺🇸 27.07.2026 18:03

From GPT-2 to gpt-oss: Analysis of Architectural Improvements and Comparison with Qwen3

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAI has released its first open-weight models since 2019 — gpt-oss-120b and gpt-oss-20b. The article examines key architectural changes compared to GPT-2: removal of dropout, replacement of absolute positional embeddings with RoPE, transition from GELU to SwiGLU, introduction of mixture of experts (MoE) and grouped query attention (GQA). It also discusses MXFP4 optimization for running on a single GPU and comparison with Qwen3 and GPT-5.
OpenAI cuối cùng đã phát hành các mô hình trọng số mở đầu tiên sau sáu năm — gpt-oss-120b và gpt-oss-20b. Không giống như GPT-2 (2019), kiến trúc đã trải qua nhiều thay đổi. Đầu tiên, dropout hoàn toàn bị loại bỏ: trong các mô hình ngôn ngữ lớn (LLM) chỉ được huấn luyện một epoch trên các tập dữ liệu khổng lồ, dropout chỉ làm giảm kết quả. Thay vì các embedding vị trí tuyệt đối như trong GPT-2, bây giờ sử dụng RoPE (Rotary Position Embedding), mã hóa vị trí bằng cách xoay vector truy vấn và khóa. Hàm kích hoạt GELU được thay thế bằng Swish rẻ hơn về mặt tính toán, và khối kết nối trực tiếp được chuyển thành mô-đun tuyến tính có cổng SwiGLU, mang lại biểu cảm cao hơn với ít tham số hơn. Ngoài ra, một khối kết nối trực tiếp duy nhất được thay thế bằng hỗn hợp các chuyên gia (MoE): với mô hình 20B, chỉ 1 trong 8 chuyên gia được kích hoạt cho mỗi token, cho phép tăng dung lượng tổng thể của mô hình mà không tăng chi phí tính toán. Cuối cùng, sự chú ý đa đầu nhường chỗ cho sự chú ý truy vấn nhóm (GQA) — các khóa và giá trị bây giờ được chia sẻ giữa nhiều đầu, tiết kiệm bộ nhớ và tăng tốc suy luận. Nhờ tối ưu hóa MXFP4, mô hình 20B vừa vặn trên một GPU tiêu dùng có 16 GB bộ nhớ, còn mô hình 120B vừa trên một H100. Bài báo cũng so sánh gpt-oss với Qwen3 (thể hiện sự cân bằng giữa chiều rộng và chiều sâu) và đề cập đến các đặc điểm của GPT-5 mới.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới