Alibaba Qwen lanceert ProcessBench en verbeterde procesbeloningsmodellen voor wiskundig redeneren
Alibaba/Qwen
OpenAI
Het Qwen-team van Alibaba heeft ProcessBench als open source uitgebracht, een benchmark voor het detecteren van fouten in stappen van wiskundig redeneren, en twee nieuwe procesbeloningsmodellen (Process Reward Models, PRM's) gelanceerd die zijn gebaseerd op Qwen2.5-Math. De modellen presteren beter dan bestaande open-source PRM's en tonen sterke foutidentificatiemogelijkheden.
Het Qwen-team van Alibaba heeft ProcessBench geïntroduceerd, een benchmark met 3.400 testgevallen die zich richten op wiskundeproblemen op wedstrijd- en olympiadeniveau, waarbij menselijke experts de vroegste foutieve stap in stapsgewijze oplossingen annoteren. Ze brachten ook twee nieuwe Process Reward Models (PRM's) uit: Qwen2.5-Math-PRM-7B en Qwen2.5-Math-PRM-72B, die gefinetuned zijn van Qwen2.5-Math-Instruct-modellen. In de Best-of-N-evaluatie (N=8) over zeven wiskunde-benchmarks presteerde Qwen2.5-Math-PRM-7B gemiddeld 1,4% beter dan meerderheidsstemming en evenaarde of overtrof het andere PRM's van vergelijkbare schaal. Op ProcessBench overtrof Qwen2.5-Math-PRM-7B GPT-4o-0806 en alle opensource-modellen, en bleef het alleen achter op o1-mini. Het team merkte ook op dat het Outcome Reward Model Qwen2.5-Math-RM-72B verrassende detectie van stapsgewijze fouten vertoonde, waardoor het sommige PRM's overtrof. Het werk is gericht op het verbeteren van procestoezicht in het redeneren van grote taalmodellen.
Bron: Alibaba Qwen —
origineel
