研究模型 🇨🇳 27.07.2026 17:05

GSPO:用于语言模型的可扩展强化学习

Alibaba/QwenAlibaba/Qwen
阿里巴巴Qwen团队提出了组序列策略优化(GSPO)算法,以解决长时强化学习训练中的不稳定性和模型崩溃问题。GSPO采用序列级优化,相比GRPO具有更高的效率和鲁棒性,特别适用于MoE模型。该算法是Qwen3模型的基础。
阿里巴巴Qwen发布了Group Sequence Policy Optimization (GSPO)算法,旨在扩展语言模型的强化学习(RL)训练规模。开发人员指出,现有的RL算法(尤其是GRPO)在长时间训练中会遇到严重的不稳定性问题,甚至可能导致模型不可逆的崩溃。GSPO基于序列似然定义重要性比率,并在序列层面(而非单个令牌层面)执行裁剪和优化。基于Qwen3-30B-A3B-Base的冷启动实验表明,GSPO的训练效率显著高于GRPO,并且随着计算量的增加能持续提升性能。GSPO的一大优势是完全消除了对Routing Replay策略的需求——在使用GRPO训练混合专家(MoE)模型时,该策略是保持稳定训练所必需的。此外,序列级别的优化使GSPO对精度误差更具容忍性,从而简化了基础设施,允许直接使用推理引擎的似然值而无需重新计算。GSPO已成功应用于Qwen3(Instruct、Coder、Thinking)的大规模强化学习训练中,显著提升了这些模型在AIME'24、LiveCodeBench和CodeForces基准测试中的表现。作者强调,GSPO中被裁剪的令牌比例比GRPO高出两个数量级,同时训练效率仍然更高,这表明序列级别的方法具有更强的鲁棒性。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻