GSPO: skaalautuvaa vahvistusoppimista kielimalleille
Alibaba/Qwen
Alibaba Qwen esitteli Group Sequence Policy Optimization (GSPO) -algoritmin ratkaisemaan epävakautta ja mallin romahtamista pitkän vahvistusoppimisen (RL) aikana. GSPO käyttää sekvenssitason optimointia, tarjoten korkeampaa tehokkuutta ja kestävyyttä verrattuna GRPO:hon, erityisesti MoE-malleille. Algoritmi on Qwen3-mallien perustana.
Alibaba Qwen on julkistanut Group Sequence Policy Optimization (GSPO) -algoritmin, joka on suunniteltu kielimallien vahvistusoppimisen (RL) skaalaamiseen. Kehittäjät totesivat, että olemassa olevat RL-algoritmit, erityisesti GRPO, kärsivät vakavasta epävakaudesta pitkäaikaisen harjoittelun aikana ja voivat johtaa mallin peruuttamattomaan romahtamiseen. GSPO määrittää importance ration sekvenssin todennäköisyyden (sequence likelihood) perusteella ja suorittaa rajausta ja optimointia sekvenssitasolla yksittäisten tokenien sijaan. Kylmäkäynnistyskokeet Qwen3-30B-A3B-Base-pohjalla osoittivat, että GSPO saavuttaa huomattavasti korkeamman harjoittelutehokkuuden kuin GRPO ja tarjoaa jatkuvaa suorituskyvyn parannusta laskentakustannusten kasvaessa. Tärkeä GSPO:n etu on sen kyky poistaa kokonaan tarve Routing Replay -strategialle, jota tarvittiin Mixture-of-Experts (MoE) -mallien vakaaseen harjoitteluun GRPO:n kanssa. Lisäksi sekvenssitason optimointi tekee GSPO:sta suvaitsevaisemman tarkkuusvirheitä kohtaan, mikä yksinkertaistaa infrastruktuuria ja mahdollistaa päätelmämoottoreiden todennäköisyyksien suoran käytön ilman uudelleenlaskentaa. GSPO:ta on sovellettu menestyksekkäästi Qwen3-mallien (Instruct, Coder ja Thinking) laajamittaisessa RL-harjoittelussa, mikä on parantanut merkittävästi niiden suorituskykyä AIME'24-, LiveCodeBench- ja CodeForces-vertailuissa. Kirjoittajat korostavat, että GSPO:ssa rajattujen tokenien osuus on kaksi kertaluokkaa suurempi kuin GRPO:ssa, mutta harjoittelutehokkuus on silti korkeampi, mikä viittaa sekvenssitason lähestymistavan suurempaan luotettavuuteen.
Lähde: Alibaba Qwen —
Alkuperäinen
