Alibaba Qwen

최신 AI 뉴스, 모델 및 출시 정보 Alibaba Qwen. ['Qwen', 'Qwen2.5', 'Qwen2.5-14B', 'Qwen2.5-32B', 'Qwen2.5-3B', 'Qwen2.5-72B', 'Qwen2.5-7B', 'Qwen2.5-Coder', 'Qwen2.5-Math', 'Qwen3-30B-A3B-Base', 'Qwen3 Coder', 'Qwen3 Instruct', 'Qwen3 Thinking', 'Qwen-Plus', 'Qwen-Turbo', 'QwQ-32B']

연구 🇨🇳

GSPO: scalable reinforcement learning for language models

Alibaba Qwen introduced the Group Sequence Policy Optimization (GSPO) algorithm to address instability and model collapse during long RL training. GSPO uses sequence-level optimization, offering higher efficiency and robustness than GRPO, especially for MoE models. The algorithm underpins the Qwen3 models.

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen27.07 · 17:05
새로운 뉴스