Alibaba Qwen veröffentlicht ProcessBench und verbesserte Process Reward Models für mathematisches Denken
Alibaba/Qwen
OpenAI
Das Qwen-Team von Alibaba hat ProcessBench als Open Source veröffentlicht, einen Benchmark zur Erkennung von Fehlern in mathematischen Denkschritten, und zwei neue Process Reward Models (PRMs) auf Basis von Qwen2.5-Math herausgebracht. Die Modelle übertreffen bestehende Open-Source-PRMs und zeigen starke Fehleridentifikationsfähigkeiten.
Das Qwen-Team von Alibaba hat ProcessBench vorgestellt, einen Benchmark mit 3.400 Testfällen, die sich auf Wettbewerbs- und Olympiade-Niveau-Mathematikprobleme konzentrieren, bei dem menschliche Experten den frühesten fehlerhaften Schritt in schrittweisen Lösungen annotieren. Sie haben außerdem zwei neue Process Reward Models (PRMs) veröffentlicht, Qwen2.5-Math-PRM-7B und Qwen2.5-Math-PRM-72B, die aus Qwen2.5-Math-Instruct-Modellen feinabgestimmt wurden. In der Best-of-N-Evaluierung (N=8) über sieben Mathematik-Benchmarks übertraf Qwen2.5-Math-PRM-7B die Mehrheitsabstimmung (Majority Voting) durchschnittlich um 1,4 % und erreichte oder übertraf andere PRMs ähnlicher Größenordnung. Auf ProcessBench übertraf Qwen2.5-Math-PRM-7B GPT-4o-0806 und alle Open-Source-Modelle und lag nur hinter o1-mini zurück. Das Team stellte außerdem fest, dass das Outcome Reward Model Qwen2.5-Math-RM-72B eine überraschende Fähigkeit zur Schrittfehlererkennung zeigte und einige PRMs übertraf. Die Arbeit zielt darauf ab, die Prozessüberwachung (Process Supervision) beim Denken von Large Language Models (LLMs) zu verbessern.
Quelle: Alibaba Qwen —
Original
