Alibaba Qwen

Latest AI news, models and releases from Alibaba Qwen. ['Qwen', 'Qwen2.5', 'Qwen2.5-14B', 'Qwen2.5-32B', 'Qwen2.5-3B', 'Qwen2.5-72B', 'Qwen2.5-7B', 'Qwen2.5-Coder', 'Qwen2.5-Math', 'Qwen2.5-Max', 'Qwen3-0.6B', 'Qwen3-14B', 'Qwen3-1.7B', 'Qwen3-235B-A22B', 'Qwen3-30B-A3B', 'Qwen3-30B-A3B-Base', 'Qwen3-32B', 'Qwen3-4B', 'Qwen3-8B', 'Qwen3 Coder', 'Qwen3 Instruct', 'Qwen3 Thinking', 'Qwen-Plus', 'Qwen-Turbo', 'QwQ-32B', 'QwQ-Max', 'QwQ-Max-Preview']

Research 🇨🇳

GSPO: scalable reinforcement learning for language models

Alibaba Qwen introduced the Group Sequence Policy Optimization (GSPO) algorithm to address instability and model collapse during long RL training. GSPO uses sequence-level optimization, offering higher efficiency and robustness than GRPO, especially for MoE models. The algorithm underpins the Qwen3 models.

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen27.07 · 17:05
Fresh news