ИсследованияМодели 🇨🇳 27.07.2026 17:05

GSPO: масштабируемое обучение с подкреплением для языковых моделей

Alibaba/QwenAlibaba/Qwen
Компания Alibaba Qwen предлагает Group Sequence Policy Optimization (GSPO) — новый алгоритм обучения с подкреплением, который решает проблему нестабильности существующих методов, таких как GRPO. GSPO использует оптимизацию на уровне последовательностей для повышения эффективности обучения, стабильности и совместимости с моделями смеси экспертов (Mixture-of-Experts), что способствует производительности моделей Qwen3.
Alibaba Qwen представляет Group Sequence Policy Optimization (GSPO) — алгоритм обучения с подкреплением, предназначенный для масштабирования обучения языковых моделей. В отличие от существующих алгоритмов, таких как Group Relative Policy Optimization (GRPO), GSPO определяет коэффициент важности на основе правдоподобия последовательности и выполняет отсечение, вознаграждение и оптимизацию на
Показать ещё ↓
Источник: Alibaba Qwen — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости