GSPO: к масштабируемому обучению с подкреплением для языковых моделей
Alibaba/Qwen
Представлен алгоритм Group Sequence Policy Optimization (GSPO), разработанный Alibaba Qwen для стабильного и эффективного обучения с подкреплением языковых моделей. GSPO использует оптимизацию на уровне последовательностей, что решает проблемы нестабильности GRPO, особенно для MoE-моделей, и обеспечивает непрерывное улучшение производительности при росте вычислительных затрат.
Исследователи из Alibaba Qwen представили алгоритм Group Sequence Policy Optimization (GSPO) для обучения с подкреплением (RL) языковых моделей. Они выявили, что существующие RL-алгоритмы, в частности GRPO, страдают от серьёзной нестабильности при длительном обучении, что приводит к необратимому коллапсу модели и ограничивает дальнейшее улучшение производительности при увеличении вычислительных ресурсов. GSPO определяет показатель значимости на основе правдоподобия последовательности и выполняет клиппирование, оценивание и оптимизацию на уровне последовательностей. Эксперименты на модели, дообученной с холодным стартом на базе Qwen3-30B-A3B-Base, показали, что GSPO обладает значительно более высокой эффективностью обучения по сравнению с GRPO и позволяет непрерывно улучшать результаты на бенчмарках AIME'24, LiveCodeBench и CodeForces. Кроме того, GSPO решает проблему нестабильности обучения MoE-моделей, устраняя необходимость в стратегии Routing Replay, которая требовалась при использовании GRPO и вносила дополнительные накладные расходы на память и коммуникацию. Благодаря оптимизации на уровне последовательностей, GSPO также более устойчив к погрешностям точности, что упрощает инфраструктуру RL. Алгоритм лёг в основу последних моделей Qwen3 (Instruct, Coder, Thinking) и позволил раскрыть потенциал масштабирования RL.
- Сокращения
- GSPO = Group Sequence Policy Optimization — групповая оптимизация политики на уровне последовательностей
- GRPO = Group Relative Policy Optimization — групповая относительная оптимизация политики
- MoE = Mixture of Experts — смесь экспертов
- RL = Reinforcement Learning — обучение с подкреплением
Источник: Alibaba Qwen —
оригинал
