OnderzoekModellen 🇺🇸 27.07.2026 18:04

SRPO: Kuaishou's nieuwe RL-methode 10 keer efficiënter dan GRPO voor LLM-training

Onderzoekers van Kuaishou's Kwaipilot-team hebben SRPO geïntroduceerd, een tweetraps versterkingsleerframework dat prestaties op DeepSeek-R1-Zero-niveau behaalt in wiskunde- en codedomeinen met slechts een tiende van de trainingsstappen. SRPO pikt cross-domein optimalisatieconflicten, lage sample-efficiëntie en voortijdige verzadiging aan door gefaseerde training en hergebruik van geschiedenis.
Het Kwaipilot-team van Kuaishou heeft SRPO (Two-Staged History-Resampling Policy Optimization) ontwikkeld, een reinforcement learning-framework voor grote taalmodellen dat beter presteert dan standaard GRPO. SRPO hanteert een tweetraps trainingsparadigma: eerst trainen op uitdagende wiskundige gegevens om redeneren uit te lokken, vervolgens het integreren van codegegevens voor het combineren van vaardigheden. History Resampling filtert eenvoudige voorbeelden met nul variantie in beloning eruit, waardoor effectieve gradientupdates worden gegarandeerd. Experimenten tonen aan dat SRPO-Qwen-32B scores van 50 op AIME24 en 41,6 op LiveCodeBench behaalt, vergelijkbaar met DeepSeek-R1-Zero-32B maar met tien keer minder trainingsstappen. Het model vertoont reflectief gedrag zoals hercontroleren, aarzeling en exploratie, en gebruikt spontaan code om wiskundige oplossingen te verifiëren. Het team heeft het model open-source gemaakt en een technisch rapport gepubliceerd.
Bron: Synced — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws