GSPO: scalable reinforcement learning for language models
Alibaba/Qwen
Alibaba Qwen introduced the Group Sequence Policy Optimization (GSPO) algorithm to address instability and model collapse during long RL training. GSPO uses sequence-level optimization, offering higher efficiency and robustness than GRPO, especially for MoE models. The algorithm underpins the Qwen3 models.
Alibaba Qwen, Group Sequence Policy Optimization (GSPO) adlı, dil modellerinin takviyeli öğrenme (RL) ile ölçeklendirilmesi için tasarlanmış bir algoritma duyurdu. Geliştiriciler, mevcut RL algoritmalarının, özellikle GRPO'nun, uzun süreli eğitimde ciddi istikrarsızlık sorunu yaşadığını ve modelin geri döndürülemez şekilde çökmesine yol açabildiğini belirtti. GSPO, önem oranını dizi olasılığına (sequence likelihood) dayanarak belirler ve kırpma ile optimizasyonu tek tek tokenlar yerine dizi düzeyinde gerçekleştirir. Qwen3-30B-A3B-Base tabanlı soğuk başlangıç deneyleri, GSPO'nun GRPO'ya kıyasla önemli ölçüde daha yüksek eğitim verimliliği elde ettiğini ve hesaplama maliyeti arttıkça performansın sürekli iyileştiğini gösterdi. GSPO'nun önemli bir avantajı, GRPO ile Mixture-of-Experts (MoE) modellerinin kararlı eğitimi için gerekli olan Routing Replay stratejisine olan ihtiyacı tamamen ortadan kaldırmasıdır. Ayrıca, dizi düzeyinde optimizasyon, GSPO'yu hassasiyet hatalarına karşı daha toleranslı hale getirerek altyapıyı basitleştirir ve yeniden hesaplama yapmadan doğrudan çıkarım motorlarından gelen olasılıkların kullanılmasına olanak tanır. GSPO, Qwen3 (Instruct, Coder, Thinking) modellerinin büyük ölçekli RL eğitiminde başarıyla uygulanmış ve bu modellerin AIME'24, LiveCodeBench ve CodeForces kıyaslamalarındaki performansını önemli ölçüde artırmıştır. Yazarlar, GSPO'da kırpılan token oranının GRPO'dakinden iki kat daha yüksek olduğunu, ancak eğitim verimliliğinin daha yüksek kaldığını vurgulayarak, dizi düzeyindeki yaklaşımın daha güvenilir olduğunu belirtmektedir.
Kaynak: Alibaba Qwen —
orijinal
