モデル研究 🇨🇳 28.07.2026 01:05

QwQ-32B:強化学習の力を活用する

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
Alibaba Qwenは、320億パラメータを持つQwQ-32Bモデルを発表しました。このモデルは、スケーラブルな強化学習(RL)を通じて、DeepSeek-R1(6710億パラメータ)に匹敵する性能を達成しています。モデルはApache 2.0ライセンスのもとでオープンソース化され、推論とエージェント機能を組み合わせています。
Alibaba傘下のQwenは、320億パラメータを備えたQwQ-32Bモデルを発表し、スケーラブルな強化学習(Reinforcement Learning、RL)を活用しています。このモデルは、6,710億パラメータ(うち370億がアクティブ)のDeepSeek-R1に匹敵する性能を達成しています。開発はコールドスタートと二段階のRLに基づいています。最初の段階では、数学およびプログラミングタスクにおいて、正確性検証器とコード実行サーバーを用いて解答を検証します。次の段階では、一般的な能力に対して、汎用報酬モデルとルールを使用します。QwQ-32Bはエージェント機能を統合しており、モデルが批判的に考え、ツールを使用し、環境からのフィードバックに適応することを可能にします。このモデルは、Apache 2.0ライセンスの下でHugging FaceとModelScopeにオープンウェイトとして提供されるほか、Qwen ChatやDashScope APIを通じても利用可能です。今後、Qwenはより強力なベースモデルとスケーラブルなRL計算を組み合わせて汎用人工知能(Artificial General Intelligence、AGI)に近づき、エージェントとRLを統合して長期的な推論を実現する計画です。
出典: Alibaba Qwen — 原文
関連記事 ↓
新着ニュース