GSPO: масштабируемое обучение с подкреплением для языковых моделей
Alibaba/Qwen
Компания Alibaba Qwen предлагает Group Sequence Policy Optimization (GSPO) — новый алгоритм обучения с подкреплением, который решает проблему нестабильности существующих методов, таких как GRPO. GSPO использует оптимизацию на уровне последовательностей для повышения эффективности обучения, стабильности и совместимости с моделями смеси экспертов (Mixture-of-Experts), что способствует производительности моделей Qwen3.
Alibaba Qwen представляет Group Sequence Policy Optimization (GSPO) — алгоритм обучения с подкреплением, предназначенный для масштабирования обучения языковых моделей. В отличие от существующих алгоритмов, таких как Group Relative Policy Optimization (GRPO), GSPO определяет коэффициент важности на основе правдоподобия последовательности и выполняет отсечение, вознаграждение и оптимизацию на
Показать ещё ↓
Источник: Alibaba Qwen —
оригинал
