⚡ 突发新闻
模型研究 🇺🇸 27.07.2026 18:03

从 GPT-2 到 gpt-oss:架构进展分析及与 Qwen3 的比较

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAI 发布了 gpt-oss-120b 和 gpt-oss-20b,这是自 GPT-2 以来的首批开放权重模型。架构采用了混合专家模型(MoE)、分组查询注意力(GQA)、旋转位置编码(RoPE)、SwiGLU 激活函数和 MXFP4 优化,支持本地推理。与 GPT-2 和 Qwen3 的对比突显了宽度与深度权衡以及注意力汇聚点方面的进展。
OpenAI发布了gpt-oss-120b和gpt-oss-20b,这是自2019年GPT-2以来,他们首批开放权重的LLM。与GPT-2相比,这些模型在架构上进行了多项改进:移除了丢弃(dropout)机制,将绝对位置嵌入替换为旋转位置编码(RoPE),激活函数从GELU改为SwiGLU,引入了混合专家模型(MoE),并采用了分组查询注意力(GQA)。MoE增加了总参数量,但每个token仅激活部分子集,从而保持了推理效率。GQA减少了键值头(key-value heads)的数量,降低了内存使用。这些模型采用MXFP4优化,可适配单GPU运行(20B模型可在16GB消费级GPU上运行,120B模型则需H100 80GB)。与Qwen3相比,gpt-oss探索了宽度与深度之间的权衡。此外,还讨论了注意力偏置和注意力汇聚(attention sinks)问题。文章在相关语境下也简短提及了GPT-5。基准测试显示其性能具有竞争力,但未提供详细得分。
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻