阿里巴巴Qwen发布ProcessBench和增强版过程奖励模型用于数学推理
阿里巴巴Qwen团队开源了ProcessBench,这是一个用于检测数学推理步骤错误的基准测试,并发布了两个基于Qwen2.5-Math的新过程奖励模型(PRM)。这些模型优于现有的开源PRM,并展现出强大的错误识别能力。
Alibaba/Qwen
OpenAI
Alibaba Qwen28.07 · 16:03
阿里巴巴Qwen团队开源了ProcessBench,这是一个用于检测数学推理步骤错误的基准测试,并发布了两个基于Qwen2.5-Math的新过程奖励模型(PRM)。这些模型优于现有的开源PRM,并展现出强大的错误识别能力。
Alibaba/Qwen
OpenAI
阿里巴巴通义千问提出了一种用于混合专家(MoE)模型的全局批次负载均衡方法,该方法通过同步所有微批次中的专家选择频率,克服了微批次级别均衡的局限性。实验表明,在各种模型大小和数据配置下,该方法提升了性能并促进了专家专业化。
Alibaba/Qwen