Alibaba Qwen publie ProcessBench et des modèles de récompense de processus améliorés pour le raisonnement mathématique
Alibaba/Qwen
OpenAI
L'équipe Qwen d'Alibaba a open-sourcé ProcessBench, un benchmark pour détecter les erreurs dans les étapes de raisonnement mathématique, et a publié deux nouveaux modèles de récompense de processus (PRMs) basés sur Qwen2.5-Math. Ces modèles surpassent les PRMs open-source existants et démontrent de solides capacités d'identification des erreurs.
L'équipe Qwen d'Alibaba a présenté ProcessBench, un benchmark comprenant 3 400 cas de test axés sur des problèmes mathématiques de niveau compétition et Olympiade, où des experts humains annotent la première étape erronée dans des solutions pas à pas. Ils ont également publié deux nouveaux Process Reward Models (PRM), Qwen2.5-Math-PRM-7B et Qwen2.5-Math-PRM-72B, affinés à partir des modèles Qwen2.5-Math-Instruct. Dans l'évaluation Best-of-N (N=8) sur sept benchmarks mathématiques, Qwen2.5-Math-PRM-7B a surpassé le vote majoritaire de 1,4% en moyenne, et égalé ou dépassé d'autres PRM de taille similaire. Sur ProcessBench, Qwen2.5-Math-PRM-7B a dépassé GPT-4o-0806 et tous les modèles open-source, se classant juste derrière o1-mini. L'équipe a également noté que le modèle de récompense de résultat (Outcome Reward Model) Qwen2.5-Math-RM-72B a montré une capacité surprenante à détecter les erreurs d'étape, surpassant certains PRM. Ce travail vise à améliorer la supervision des processus dans le raisonnement des grands modèles de langage.
Source: Alibaba Qwen —
original
