SRPO : nouvelle méthode de RL de Kuaishou 10 fois plus efficace que GRPO pour l'entraînement des LLM
Des chercheurs de Kuaishou ont introduit SRPO, une méthode d'apprentissage par renforcement en deux étapes qui atteint les performances de DeepSeek-R1-Zero sur des tâches de mathématiques et de code en 1/10 des étapes d'entraînement. La méthode résout les problèmes de conflits inter-domaines et d'utilisation inefficace des échantillons inhérents à GRPO standard.

