InvestigaciónModelos 🇺🇸 27.07.2026 18:04

SRPO: el nuevo método de RL de Kuaishou es 10 veces más eficiente que GRPO para el entrenamiento de LLM

Investigadores del equipo Kwaipilot de Kuaishou han presentado SRPO, un marco de aprendizaje por refuerzo de dos etapas que alcanza un rendimiento al nivel de DeepSeek-R1-Zero en dominios de matemáticas y código con solo una décima parte de los pasos de entrenamiento. SRPO aborda conflictos de optimización entre dominios, baja eficiencia de muestreo y saturación prematura mediante entrenamiento por etapas y remuestreo de historial.
El equipo de Kwaipilot de Kuaishou ha desarrollado SRPO (Optimización de Políticas mediante Remuestreo Histórico en Dos Etapas, por sus siglas en inglés), un marco de aprendizaje por refuerzo para modelos de lenguaje extenso que supera al estándar GRPO. SRPO emplea un paradigma de entrenamiento en dos etapas: primero, entrenamiento con datos matemáticos desafiantes para generar razonamiento; luego, integración de datos de código para combinar habilidades. El Remuestreo Histórico filtra muestras fáciles con varianza de recompensa cero, garantizando actualizaciones de gradiente efectivas. Los experimentos muestran que SRPO-Qwen-32B obtiene puntuaciones de 50 en AIME24 y 41.6 en LiveCodeBench, comparable a DeepSeek-R1-Zero-32B, pero con 10 veces menos pasos de entrenamiento. El modelo exhibe comportamientos reflexivos como revisión, vacilación y exploración, y utiliza código espontáneamente para verificar soluciones matemáticas. El equipo ha liberado el modelo como código abierto y ha publicado un informe técnico.
Fuente: Synced — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas