ИсследованияМодели 🇨🇳 27.07.2026 17:05

GSPO: масштабируемое обучение с подкреплением для языковых моделей

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen представила алгоритм Group Sequence Policy Optimization (GSPO), который решает проблемы нестабильности и коллапса модели при длительном RL-обучении. GSPO использует sequence-level оптимизацию, что обеспечивает более высокую эффективность и устойчивость по сравнению с GRPO, особенно для MoE-моделей. Алгоритм лёг в основу моделей Qwen3.
Alibaba Qwen анонсировала алгоритм Group Sequence Policy Optimization (GSPO), предназначенный для масштабирования обучения с подкреплением (RL) языковых моделей. Разработчики отметили, что существующие RL-алгоритмы, в частности GRPO, страдают от серьёзной нестабильности при длительном обучении и могут приводить к необратимому коллапсу модели. GSPO определяет importance ratio на основе
Показать ещё ↓
Сокращения
GRPO = Group Relative Policy Optimization — групповая относительная оптимизация политики
GSPO = Group Sequence Policy Optimization — групповая оптимизация политики на основе последовательностей
MoE = Mixture of Experts — смесь экспертов
RL = Reinforcement Learning — обучение с подкреплением
Источник: Alibaba Qwen — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости