ИсследованияМодели 🇺🇸 27.07.2026 18:04

SRPO: новый метод обучения с подкреплением от Kuaishou в 10 раз эффективнее GRPO для тренировки больших языковых моделей

Исследователи из команды Kuaishou Kwaipilot представили SRPO — двухэтапный фреймворк обучения с подкреплением, который достигает производительности DeepSeek-R1-Zero в области математики и кода всего за одну десятую часть шагов обучения. SRPO решает проблемы конфликтов оптимизации между доменами, низкой эффективности выборки и преждевременного насыщения за счет поэтапного обучения и повторной выборки истории.
Команда Kwaipilot из Kuaishou разработала SRPO (Two-Staged history-Resampling Policy Optimization — двухэтапная оптимизация политики с пересэмплированием истории), фреймворк обучения с подкреплением для больших языковых моделей, который превосходит стандартный GRPO (Group Relative Policy Optimization — групповая относительная оптимизация политики). SRPO использует двухэтапную парадигму обучения:
Показать ещё ↓
Источник: Synced — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости