GSPO: schaalbare reinforcement learning voor taalmodellen
Alibaba/Qwen
Alibaba Qwen introduceerde het Group Sequence Policy Optimization (GSPO)-algoritme om instabiliteit en modelinstorting tijdens lange RL-training aan te pakken. GSPO maakt gebruik van optimalisatie op sequentieniveau en biedt een hogere efficiëntie en robuustheid dan GRPO, vooral voor MoE-modellen. Het algoritme vormt de basis voor de Qwen3-modellen.
Alibaba Qwen heeft het algoritme Group Sequence Policy Optimization (GSPO) aangekondigd, bedoeld voor het opschalen van reinforcement learning (RL) van taalmodellen. De ontwikkelaars merkten op dat bestaande RL-algoritmen, met name GRPO, lijden onder ernstige instabiliteit bij langdurige training en kunnen leiden tot onomkeerbare ineenstorting van het model. GSPO definieert een importance ratio op basis van de waarschijnlijkheid van de reeks (sequence likelihood) en voert clipping en optimalisatie uit op sequentieniveau in plaats van op individuele tokens. Experimenten met een cold start op basis van Qwen3-30B-A3B-Base toonden aan dat GSPO een aanzienlijk hogere trainingsefficiëntie bereikt dan GRPO en zorgt voor een continue prestatieverbetering bij toenemende rekenkosten. Een belangrijk voordeel van GSPO is de volledige eliminatie van de noodzaak van een Routing Replay-strategie, die vereist was voor stabiele training van Mixture-of-Experts (MoE)-modellen met GRPO. Bovendien maakt de optimalisatie op sequentieniveau GSPO toleranter voor nauwkeurigheidsfouten, wat de infrastructuur vereenvoudigt en het mogelijk maakt om direct gebruik te maken van de waarschijnlijkheid van inferentie-engines zonder herberekening. GSPO is succesvol toegepast in grootschalige RL-training van Qwen3-modellen (Instruct, Coder, Thinking), wat heeft geleid tot aanzienlijke prestatieverbeteringen in de benchmarks AIME'24, LiveCodeBench en CodeForces. De auteurs benadrukken dat het aandeel van geclipte tokens in GSPO twee ordes van grootte hoger is dan in GRPO, terwijl de trainingsefficiëntie hoger blijft, wat wijst op een grotere betrouwbaarheid van de sequentieniveau-aanpak.
Bron: Alibaba Qwen —
origineel
