モデル研究 🇨🇳 28.07.2026 16:03

アリババQwen、数学的推論のためのProcessBenchと改良されたプロセス報酬モデルを公開

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
アリババのQwenチームは、数学的推論のステップにおけるエラーを検出するためのベンチマーク「ProcessBench」をオープンソース化し、Qwen2.5-Mathに基づく2つの新しいプロセス報酬モデル(PRM)を公開しました。これらのモデルは、既存のオープンソースPRMを上回る性能を示し、強力なエラー識別能力を発揮します。
AlibabaのQwenチームは、競技およびオリンピックレベルの数学問題に焦点を当てた3,400のテストケースを含むベンチマーク「ProcessBench」を発表しました。このベンチマークでは、人間の専門家が段階的な解答の中で最初の誤りステップに注釈を付けます。また、Qwen2.5-Math-Instructモデルからファインチューニングされた2つの新しいプロセス報酬モデル(Process Reward Model、PRM)「Qwen2.5-Math-PRM-7B」と「Qwen2.5-Math-PRM-72B」も公開しました。7つの数学ベンチマークにおけるBest-of-N評価(N=8)では、Qwen2.5-Math-PRM-7Bが多数決投票よりも平均1.4%優れた性能を示し、同等規模の他のPRMに匹敵またはそれを上回りました。ProcessBenchでは、Qwen2.5-Math-PRM-7BがGPT-4o-0806とすべてのオープンソースモデルを凌駕し、o1-miniにのみ劣りました。チームはまた、結果報酬モデル(Outcome Reward Model、ORM)であるQwen2.5-Math-RM-72Bが、驚くべきステップ誤り検出能力を示し、一部のPRMを上回ったことにも言及しています。この研究は、大規模言語モデル(Large Language Model、LLM)の推論におけるプロセス監視の改善を目的としています。
出典: Alibaba Qwen — 原文
関連記事 ↓
新着ニュース