SRPO: Nieuwe RL-methode van Kuaishou 10x efficiënter dan GRPO voor LLM-training
Onderzoekers van Kuaishou introduceerden SRPO, een tweetraps reinforcement learning-methode die prestaties op DeepSeek-R1-Zero-niveau behaalt voor wiskunde- en codeertaken in 1/10 van de trainingsstappen. De methode pakt cross-domeinconflicten en inefficiënte samplebenutting aan, die inherent zijn aan standaard GRPO.

