GSPO: scalable reinforcement learning for language models
Alibaba/Qwen
Alibaba Qwen introduced the Group Sequence Policy Optimization (GSPO) algorithm to address instability and model collapse during long RL training. GSPO uses sequence-level optimization, offering higher efficiency and robustness than GRPO, especially for MoE models. The algorithm underpins the Qwen3 models.
알리바바의 Qwen이 언어 모델의 강화 학습(RL)을 확장하기 위한 알고리즘인 Group Sequence Policy Optimization(GSPO)을 발표했습니다. 개발자들은 기존의 RL 알고리즘, 특히 GRPO가 장시간 학습 시 심각한 불안정성을 겪고 모델의 돌이킬 수 없는 붕괴를 초래할 수 있다고 지적했습니다. GSPO는 시퀀스 우도(sequence likelihood)를 기반으로 importance ratio를 정의하고, 개별 토큰이 아닌 시퀀스 수준에서 클리핑과 최적화를 수행합니다. Qwen3-30B-A3B-Base를 사용한 콜드 스타트 실험에서 GSPO는 GRPO보다 훨씬 높은 학습 효율성을 달성했으며, 계산 비용이 증가함에 따라 지속적인 성능 향상을 보였습니다. GSPO의 중요한 장점은 GRPO로 Mixture-of-Experts(MoE) 모델을 안정적으로 학습하는 데 필요했던 Routing Replay 전략이 완전히 필요 없다는 것입니다. 또한, 시퀀스 수준 최적화는 GSPO가 정밀도 오류에 더 관대하게 만들어 인프라를 단순화하고, 재계산 없이 추론 엔진의 우도를 직접 사용할 수 있게 합니다. GSPO는 Qwen3(Instruct, Coder, Thinking) 모델의 대규모 RL 학습에 성공적으로 적용되어, AIME'24, LiveCodeBench, CodeForces 벤치마크에서 성능을 크게 향상시켰습니다. 저자들은 GSPO에서 클리핑된 토큰의 비율이 GRPO보다 두 자릿수 높지만 학습 효율성은 여전히 더 높아, 시퀀스 수준 접근 방식의 신뢰성이 더 크다는 점을 강조합니다.
출처: Alibaba Qwen —
원문
