RechercheModèles 🇺🇸 27.07.2026 18:04

SRPO : la nouvelle méthode de RL de Kuaishou 10 fois plus efficace que GRPO pour l'entraînement des LLM

Les chercheurs de l'équipe Kwaipilot de Kuaishou ont introduit SRPO, un cadre d'apprentissage par renforcement en deux étapes qui atteint des performances de niveau DeepSeek-R1-Zero dans les domaines des mathématiques et du code avec seulement un dixième des étapes d'entraînement. SRPO résout les conflits d'optimisation inter-domaines, la faible efficacité d'échantillonnage et la saturation prématurée grâce à un entraînement par étapes et au rééchantillonnage de l'historique.
L'équipe Kwaipilot de Kuaishou a développé SRPO (Two-Staged history-Resampling Policy Optimization), un cadre d'apprentissage par renforcement pour les grands modèles de langage qui surpasse le GRPO standard. SRPO adopte un paradigme d'entraînement en deux étapes : d'abord, un entraînement sur des données mathématiques difficiles pour susciter le raisonnement, puis l'intégration de données de code pour combiner les compétences. History Resampling filtre les échantillons faciles à variance de récompense nulle, garantissant des mises à jour de gradient efficaces. Les expériences montrent que SRPO-Qwen-32B obtient des scores de 50 sur AIME24 et 41,6 sur LiveCodeBench, comparables à DeepSeek-R1-Zero-32B mais avec 10 fois moins d'étapes d'entraînement. Le modèle présente des comportements réflexifs comme la revérification, l'hésitation et l'exploration, et utilise spontanément le code pour vérifier les solutions mathématiques. L'équipe a open-sourcé le modèle et publié un rapport technique.
Source: Synced — original
Nos articles précédents sur ce sujet ↓
Infos fraîches