SRPO: Neue RL-Methode von Kuaishou 10x effizienter als GRPO für LLM-Training
Forscher von Kuaishou haben SRPO entwickelt, eine zweistufige Reinforcement-Learning-Methode, die mit 1/10 der Trainingsschritte DeepSeek-R1-Zero-Niveau bei Mathematik- und Codierungsaufgaben erreicht. Die Methode adressiert domänenübergreifende Konflikte und ineffiziente Sample-Nutzung, die GRPO inhärent sind.

