SRPO: Uusi RL-menetelmä Kuaishoulta, 10 kertaa tehokkaampi kuin GRPO LLM-koulutuksessa
Kuaishoun tutkijat esittelivät SRPO:n, kaksivaiheisen vahvistusoppimismenetelmän, joka saavuttaa DeepSeek-R1-Zero-tason suorituskyvyn matematiikka- ja kooditehtävissä kymmenesosassa harjoitusvaiheista. Menetelmä ratkaisee standardin GRPO:n luontaisia ongelmia, kuten toimialueiden välisiä ristiriitoja ja tehottomia näytteiden hyödyntämistä.

