SRPO: Nuevo método de RL de Kuaishou 10 veces más eficiente que GRPO para el entrenamiento de LLM
Investigadores de Kuaishou presentaron SRPO, un método de aprendizaje por refuerzo de dos etapas que alcanza un rendimiento similar a DeepSeek-R1-Zero en tareas de matemáticas y código en una décima parte de los pasos de entrenamiento. El método aborda los conflictos entre dominios y la utilización ineficiente de muestras inherentes a GRPO estándar.

