уровне последовательностей. Такой подход решает серьезные проблемы нестабильности, наблюдаемые в GRPO при длительном обучении, включая необратимый коллапс модели. GSPO демонстрирует значительно более высокую эффективность обучения, достигая лучшей производительности при одинаковых затратах на обучение, и позволяет непрерывно улучшать показатели по мере увеличения вычислительных ресурсов. Алгоритм также внутренне стабилизирует обучение больших моделей смеси экспертов (Mixture-of-Experts, MoE), устраняя необходимость в стратегии Routing Replay, требуемой для GRPO. Кроме того, GSPO более толерантен к различиям в точности, что делает его удобным для инфраструктуры в сценариях, таких как частичный развертывание и многошаговое обучение с подкреплением. GSPO был успешно применен для крупномасштабного обучения с подкреплением новейших моделей Qwen3, что позволило еще больше раскрыть потенциал масштабирования через обучение с подкреплением.