GSPO: Aprendizaje por Refuerzo Escalable para Modelos de Lenguaje
Alibaba/Qwen
Alibaba Qwen propone Group Sequence Policy Optimization (GSPO), un nuevo algoritmo de aprendizaje por refuerzo que aborda la inestabilidad en métodos existentes como GRPO. GSPO utiliza optimización a nivel de secuencia para mejorar la eficiencia del entrenamiento, la estabilidad y la compatibilidad con modelos MoE (Mixture-of-Experts), contribuyendo al rendimiento de los modelos Qwen3.
Alibaba Qwen presenta Group Sequence Policy Optimization (GSPO), un algoritmo de aprendizaje por refuerzo diseñado para escalar el entrenamiento de modelos de lenguaje. A diferencia de algoritmos existentes como GRPO, GSPO define el ratio de importancia basándose en la verosimilitud de la secuencia y realiza clipping, recompensa y optimización a nivel de secuencia. Este enfoque resuelve los graves problemas de inestabilidad observados en GRPO durante entrenamientos largos, incluido el colapso irreversible del modelo. GSPO demuestra una eficiencia de entrenamiento significativamente mayor, logrando un mejor rendimiento bajo el mismo costo de entrenamiento, y permite mejoras continuas en el rendimiento con mayor capacidad de cómputo. Además, estabiliza inherentemente el entrenamiento de grandes modelos Mixture-of-Experts (MoE), eliminando la necesidad de la estrategia de Routing Replay requerida por GRPO. GSPO también es más tolerante a las discrepancias de precisión, lo que lo hace amigable para la infraestructura en escenarios como rollout parcial y refuerzo por refuerzo en múltiples turnos (multi-turn RL, por sus siglas en inglés). GSPO se ha aplicado con éxito al entrenamiento con refuerzo a gran escala de los últimos modelos Qwen3, liberando aún más el potencial del escalado por refuerzo.
Fuente: Alibaba Qwen —
original
