SRPO: новый метод RL от Kuaishou в 10 раз эффективнее GRPO для обучения LLM
Исследователи из Kuaishou представили SRPO — двухэтапный метод обучения с подкреплением, который позволяет достичь уровня DeepSeek-R1-Zero на задачах математики и кода за 1/10 шагов обучения. Метод решает проблемы кросс-доменных конфликтов и неэффективного использования выборок, присущие стандартному GRPO.
Synced27.07 · 18:04
