GSPO: Schaalbare Versterkingsleren voor Taalmodellen
Alibaba/Qwen
Alibaba's Qwen stelt Group Sequence Policy Optimization (GSPO) voor, een nieuw RL-algoritme dat instabiliteit in bestaande methoden zoals GRPO aanpakt. GSPO gebruikt optimalisatie op sequentieniveau om de trainingsefficiëntie, stabiliteit en compatibiliteit met Mixture-of-Experts-modellen te verbeteren, wat bijdraagt aan de prestaties van Qwen3-modellen.
Alibaba Qwen introduceert Group Sequence Policy Optimization (GSPO), een reinforcement learning-algoritme ontworpen om de training van taalmodellen te schalen. In tegenstelling tot bestaande algoritmen zoals GRPO, definieert GSPO de importance ratio op basis van sequentielikelihood en voert het clipping, beloning en optimalisatie op sequentieniveau uit. Deze aanpak lost ernstige instabiliteitsproblemen op die bij GRPO worden waargenomen tijdens langdurige training, waaronder onomkeerbare modelcollapse. GSPO toont een aanzienlijk hogere trainingsefficiëntie, behaalt betere prestaties onder dezelfde trainingskosten en maakt continue prestatieverbeteringen mogelijk met meer rekenkracht. Het stabiliseert ook inherent de training van grote Mixture-of-Experts (MoE)-modellen, waardoor de Routing Replay-strategie die GRPO vereist, overbodig wordt. Bovendien is GSPO toleranter voor precisieverschillen, waardoor het infrastructuurvriendelijk is voor scenario's zoals gedeeltelijke rollout en multi-turn reinforcement learning (RL). GSPO is met succes toegepast op de grootschalige RL-training van de nieuwste Qwen3-modellen, waardoor het potentieel van RL-schaling verder wordt ontketend.
Bron: Alibaba Qwen —
origineel
