SRPO: Kuaishoun uusi RL-menetelmä 10 kertaa tehokkaampi kuin GRPO LLM-koulutuksessa
Kuaishoun Kwaipilot-tiimin tutkijat ovat esitelleet SRPO:n, kaksivaiheisen vahvistusoppimiskehyksen, joka saavuttaa DeepSeek-R1-Zero-tason suorituskyvyn matematiikan ja koodin aloilla vain kymmenesosalla harjoitusvaiheista. SRPO ratkaisee cross-domain-optimointikonfliktit, alhaisen näytetehokkuuden ja ennenaikaisen kyllästymisen vaiheistetun harjoittelun ja historian uudelleennäytteistyksen avulla.
Kuaishoun Kwaipilot-tiimi kehitti SRPO:n (Two-Staged history-Resampling Policy Optimization), vahvistusoppimiskehyksen suurille kielimalleille, joka päihittää tavallisen GRPO:n. SRPO käyttää kaksivaiheista harjoitusparadigmaa: ensin haastavalla matematiikkadatalla harjoitetaan päättelykykyä, minkä jälkeen integroidaan koodidata taitojen yhdistämiseksi. History Resampling suodattaa pois helpot näytteet, joissa palkkion varianssi on nolla, varmistaen tehokkaat gradienttipäivitykset. Kokeet osoittavat, että SRPO-Qwen-32B saavuttaa pisteet 50 AIME24:ssä ja 41,6 LiveCodeBenchissä, verrattavissa DeepSeek-R1-Zero-32B:hen, mutta kymmenen kertaa vähemmillä harjoitusaskelilla. Malli osoittaa reflektoivaa käyttäytymistä kuten uudelleentarkistamista, epäröintiä ja tutkimista, ja se käyttää spontaanisti koodia matemaattisten ratkaisujen vahvistamiseen. Tiimi julkaisi mallin avoimena lähdekoodina ja julkaisi teknisen raportin.
Lähde: Synced —
Alkuperäinen
