TutkimusMallit 🇨🇳 27.07.2026 17:05

GSPO: Skaalautuvaa vahvistusoppia kielimalleille

Alibaba/QwenAlibaba/Qwen
Alibaban Qwen ehdottaa Group Sequence Policy Optimization (GSPO) -algoritmia, uutta vahvistusoppialgoritmia, joka ratkaisee olemassa olevien menetelmien, kuten GRPO:n, epävakautta. GSPO käyttää sekvenssitason optimointia parantaakseen koulutuksen tehokkuutta, vakautta ja yhteensopivuutta Mixture-of-Experts-mallien kanssa, mikä edistää Qwen3-mallien suorituskykyä.
Alibaba Qwen esittelee Group Sequence Policy Optimization (GSPO) -nimisen vahvistusoppimisalgoritmin, joka on suunniteltu kielimallien koulutuksen skaalaamiseen. Toisin kuin olemassa olevat algoritmit, kuten GRPO, GSPO määrittelee tärkeyssuhteen sekvenssin todennäköisyyden perusteella ja suorittaa sekvenssitason leikkauksen, palkitsemisen ja optimoinnin. Tämä lähestymistapa ratkaisee GRPO:ssa pitkän koulutuksen aikana havaitut vakavat epävakausongelmat, mukaan lukien peruuttamattoman mallin romahduksen. GSPO osoittaa huomattavasti korkeampaa koulutustehokkuutta, saavuttaen paremman suorituskyvyn samoilla koulutuskustannuksilla, ja mahdollistaa jatkuvan suorituskyvyn parantamisen laskentatehon kasvaessa. Se myös vakauttaa luonnostaan suurten Mixture-of-Experts (MoE) -mallien koulutuksen, poistaen tarpeen GRPO:n edellyttämälle Routing Replay -strategialle. Lisäksi GSPO sietää paremmin tarkkuuseroja, mikä tekee siitä infrastruktuuriystävällisen osittaisen käyttöönoton ja monikierroksen vahvistusoppimisen kaltaisissa skenaarioissa. GSPO:ta on sovellettu menestyksekkäästi uusimpien Qwen3-mallien laajaan vahvistusoppimiskoulutukseen, mikä on vapauttanut entisestään vahvistusoppimisen skaalauksen potentiaalia.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset