⚡ TIN NÓNG
Mô hìnhNghiên cứu 🇺🇸 27.07.2026 18:03

Từ GPT-2 đến gpt-oss: Phân tích tiến bộ kiến trúc và so sánh với Qwen3

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAI vừa phát hành gpt-oss-120b và gpt-oss-20b, những mô hình có trọng số mở đầu tiên kể từ GPT-2. Kiến trúc sử dụng Mixture-of-Experts (hỗn hợp chuyên gia), Grouped Query Attention (chú ý truy vấn nhóm), RoPE, SwiGLU, và tối ưu hóa MXFP4 cho suy luận cục bộ. So sánh với GPT-2 và Qwen3 làm nổi bật sự đánh đổi giữa chiều rộng và chiều sâu cũng như các sink chú ý (attention sinks).
OpenAI phát hành gpt-oss-120b và gpt-oss-20b, các mô hình ngôn ngữ lớn mã nguồn mở đầu tiên kể từ GPT-2 năm 2019. Các mô hình này tích hợp một số cải tiến kiến trúc so với GPT-2: loại bỏ dropout, thay thế positional embedding tuyệt đối bằng RoPE, chuyển hàm kích hoạt từ GELU sang SwiGLU, thêm Mixture-of-Experts (MoE) và sử dụng Grouped Query Attention. MoE làm tăng tổng tham số nhưng chỉ kích hoạt một tập con cho mỗi token, giữ cho suy luận hiệu quả. GQA giảm số lượng key-value head để giảm sử dụng bộ nhớ. Các mô hình sử dụng tối ưu hóa MXFP4 để vừa trên GPU đơn (20B trên GPU tiêu dùng 16GB, 120B trên H100 80GB). So với Qwen3, gpt-oss khám phá sự đánh đổi giữa chiều rộng và chiều sâu. Attention bias và sinks cũng được thảo luận. Bài báo cũng đề cập ngắn gọn đến GPT-5 trong bối cảnh. Các điểm chuẩn cho thấy hiệu suất cạnh tranh, mặc dù điểm số chi tiết không được cung cấp.
Nguồn: Sebastian Raschka — bản gốc
Bài viết liên quan trước đây ↓
Tin mới