从GPT-2到gpt-oss:架构改进分析及与Qwen3的对比
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI发布了自2019年以来的首批开源权重模型——gpt-oss-120b和gpt-oss-20b。文章分析了与GPT-2相比的关键架构变化:去除dropout、将绝对位置嵌入替换为旋转位置编码(RoPE)、从GELU激活函数转向SwiGLU、引入混合专家模型(MoE)和分组查询注意力(GQA)。此外,还讨论了在单GPU上运行的MXFP4优化以及与Qwen3和GPT-5的对比。
OpenAI 终于发布了六年来首批开放权重的模型——gpt-oss-120b 和 gpt-oss-20b。与 GPT-2(2019 年)相比,架构发生了诸多变化。首先,完全去除了 dropout:在仅训练一个 epoch 且使用海量数据集的 LLM 中,dropout 只会降低性能。其次,不再使用 GPT-2 中的绝对位置嵌入,而是采用 RoPE(旋转变换位置编码),通过旋转查询和键向量来编码位置。激活函数也从 GELU 换成了计算成本更低的 Swish,前馈块则改为门控线性单元 SwiGLU,在参数更少的情况下提供更强的表达能力。此外,单一的前馈模块被替换为混合专家模型(MoE):20B 模型每个 token 仅激活 8 个专家中的 1 个,从而在不增加计算成本的前提下提升模型整体容量。最后,多头注意力让位于分组查询注意力(GQA)——键和值在多个注意力头之间共享,节省内存并加速推理。得益于 MXFP4 优化,20B 模型可装入 16 GB 显存的消费级 GPU,而 120B 模型则能单卡运行在 H100 上。文章还将 gpt-oss 与 Qwen3 进行了对比(展示了宽度与深度的平衡),并探讨了新版 GPT-5 的特点。
来源: Sebastian Raschka —
原文
