ModellenOnderzoek 🇨🇳 28.07.2026 16:03

Alibaba Qwen brengt ProcessBench en verbeterde procesbeloningsmodellen uit voor wiskundig redeneren

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Het Qwen-team van Alibaba heeft ProcessBench open-source gemaakt, een benchmark voor het detecteren van fouten in wiskundige redeneerstappen, en twee nieuwe procesbeloningsmodellen (PRM's) uitgebracht op basis van Qwen2.5-Math. De modellen presteren beter dan bestaande open-source PRM's en vertonen sterke foutidentificatiemogelijkheden.
Het Qwen-team van Alibaba heeft ProcessBench geïntroduceerd, een benchmark met 3.400 testgevallen die zich richten op wiskundeproblemen op wedstrijd- en olympiadeniveau, waarbij menselijke experts de vroegste foutieve stap in stapsgewijze oplossingen annoteren. Ze brachten ook twee nieuwe Process Reward Models (PRM's) uit: Qwen2.5-Math-PRM-7B en Qwen2.5-Math-PRM-72B, die gefinetuned zijn van Qwen2.5-Math-Instruct-modellen. In de Best-of-N-evaluatie (N=8) over zeven wiskunde-benchmarks presteerde Qwen2.5-Math-PRM-7B gemiddeld 1,4% beter dan meerderheidsstemming en evenaarde of overtrof het andere PRM's van vergelijkbare schaal. Op ProcessBench overtrof Qwen2.5-Math-PRM-7B GPT-4o-0806 en alle opensource-modellen, en bleef het alleen achter op o1-mini. Het team merkte ook op dat het Outcome Reward Model Qwen2.5-Math-RM-72B verrassende detectie van stapsgewijze fouten vertoonde, waardoor het sommige PRM's overtrof. Het werk is gericht op het verbeteren van procestoezicht in het redeneren van grote taalmodellen.
Bron: Alibaba Qwen — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws