ForschungModelle 🇺🇸 27.07.2026 18:04

SRPO: Kuaishous neue RL-Methode 10-mal effizienter als GRPO für LLM-Training

Forscher des Kuaishou-Kwaipilot-Teams haben SRPO vorgestellt, ein zweistufiges Reinforcement-Learning-Framework, das DeepSeek-R1-Zero-Niveau in Mathematik und Code-Domänen mit nur einem Zehntel der Trainingsschritte erreicht. SRPO adressiert domänenübergreifende Optimierungskonflikte, geringe Sample-Effizienz und vorzeitige Sättigung durch stufenweises Training und History-Resampling.
Das Kwaipilot-Team von Kuaishou hat SRPO (Two-Staged history-Resampling Policy Optimization) entwickelt, ein Reinforcement-Learning-Framework für große Sprachmodelle, das das Standard-GRPO übertrifft. SRPO verwendet ein zweistufiges Trainingsparadigma: Zunächst wird das Modell mit anspruchsvollen Mathematikdaten trainiert, um logisches Denken zu fördern. Anschließend werden Codedaten integriert, um Fähigkeiten zu kombinieren. Das History Resampling filtert einfache Beispiele ohne Varianz in der Belohnungsfunktion heraus, um effektive Gradientenaktualisierungen sicherzustellen. Experimente zeigen, dass SRPO-Qwen-32B auf AIME24 50 Punkte und auf LiveCodeBench 41,6 Punkte erreicht, vergleichbar mit DeepSeek-R1-Zero-32B, jedoch mit zehnmal weniger Trainingsschritten. Das Modell zeigt reflektierende Verhaltensweisen wie Überprüfen, Zögern und Erkunden und verwendet spontan Code, um mathematische Lösungen zu verifizieren. Das Team hat das Modell als Open Source veröffentlicht und einen technischen Bericht publiziert.
Quelle: Synced — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten