模型研究 🇨🇳 28.07.2026 16:03

阿里巴巴Qwen发布ProcessBench和增强版过程奖励模型用于数学推理

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
阿里巴巴Qwen团队开源了ProcessBench,这是一个用于检测数学推理步骤错误的基准测试,并发布了两个基于Qwen2.5-Math的新过程奖励模型(PRM)。这些模型优于现有的开源PRM,并展现出强大的错误识别能力。
阿里巴巴的通义千问团队推出了ProcessBench基准测试,包含3400个聚焦于竞赛和奥林匹克级别数学问题的测试用例,由人类专家标注逐步解题过程中的首个错误步骤。同时,他们发布了两个新的过程奖励模型(PRMs):Qwen2.5-Math-PRM-7B和Qwen2.5-Math-PRM-72B,这两者是基于Qwen2.5-Math-Instruct模型微调而来。在七个数学基准测试的Best-of-N评估中(N=8),Qwen2.5-Math-PRM-7B平均比多数投票高出1.4%,并且达到或超过了同规模的其他PRMs。在ProcessBench上,Qwen2.5-Math-PRM-7B超越了GPT-4o-0806及所有开源模型,仅落后于o1-mini。团队还指出,结果奖励模型Qwen2.5-Math-RM-72B展现出令人惊讶的步骤错误检测能力,超越了一些PRMs。该工作旨在改进大语言模型推理中的过程监督。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻