GSPO: масштабируемое обучение с подкреплением для языковых моделей
Alibaba/Qwen
Alibaba Qwen представила алгоритм Group Sequence Policy Optimization (GSPO), который решает проблемы нестабильности и коллапса модели при длительном RL-обучении. GSPO использует sequence-level оптимизацию, что обеспечивает более высокую эффективность и устойчивость по сравнению с GRPO, особенно для MoE-моделей. Алгоритм лёг в основу моделей Qwen3.
Alibaba Qwen анонсировала алгоритм Group Sequence Policy Optimization (GSPO), предназначенный для масштабирования обучения с подкреплением (RL) языковых моделей. Разработчики отметили, что существующие RL-алгоритмы, в частности GRPO, страдают от серьёзной нестабильности при длительном обучении и могут приводить к необратимому коллапсу модели. GSPO определяет importance ratio на основе
Показать ещё ↓
- Сокращения
- GRPO = Group Relative Policy Optimization — групповая относительная оптимизация политики
- GSPO = Group Sequence Policy Optimization — групповая оптимизация политики на основе последовательностей
- MoE = Mixture of Experts — смесь экспертов
- RL = Reinforcement Learning — обучение с подкреплением
Источник: Alibaba Qwen —
оригинал
