模型研究 🇨🇳 28.07.2026 01:05

QwQ-32B:利用强化学习的力量

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
阿里巴巴通义千问发布了拥有320亿参数的QwQ-32B模型,通过可扩展的强化学习(RL)实现了与DeepSeek-R1(6710亿参数)相当的性能。该模型在Apache 2.0许可证下开源,并结合了推理与智能体能力。
阿里巴巴的Qwen推出了QwQ-32B模型,拥有320亿参数,利用可扩展的强化学习技术。该模型性能可媲美DeepSeek-R1(后者拥有6710亿参数,其中370亿为激活参数)。其开发基于冷启动和两阶段强化学习:第一阶段,在数学和编程任务上使用正确性验证器和代码执行服务器来验证解决方案;第二阶段,使用通用奖励模型和规则来增强通用能力。QwQ-32B集成了智能体能力,使模型能够进行批判性思考、使用工具并适应环境反馈。该模型以开放权重形式发布于Hugging Face和ModelScope,采用Apache 2.0许可证,也可通过Qwen Chat和DashScope API访问。未来,Qwen计划将更强的基座模型与可扩展的强化学习计算相结合,以接近通用人工智能,并将智能体与强化学习整合以实现长期推理。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻