MallitTutkimus 🇨🇳 28.07.2026 16:03

Alibaba Qwen julkaisee ProcessBench-vertailuarvon ja parannetut prosessipalkkiomallit matemaattista päättelyä varten

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Alibaba Qwen -tiimi on avannut lähdekoodina ProcessBench-vertailuarvon, joka on tarkoitettu virheiden havaitsemiseen matemaattisissa päättelyvaiheissa. Lisäksi on julkaistu kaksi uutta prosessipalkkiomallia (Process Reward Model, PRM), jotka perustuvat Qwen2.5-Math-malliin. Mallit ylittävät olemassa olevat avoimen lähdekoodin PRM-mallit ja osoittavat vahvaa virheentunnistuskykyä.
Alibaban Qwen-tiimi esitteli ProcessBenchin, vertailuarvon, joka sisältää 3 400 testitapausta kilpailu- ja olympiatason matematiikan ongelmista, joissa ihmisasiantuntijat merkitsevät varhaisimman virheellisen vaiheen vaiheittaisissa ratkaisuissa. He julkaisivat myös kaksi uutta prosessipalkkiomallia (PRM), Qwen2.5-Math-PRM-7B:n ja Qwen2.5-Math-PRM-72B:n, jotka on hienosäädetty Qwen2.5-Math-Instruct-malleista. Best-of-N-arvioinnissa (N=8) seitsemällä matematiikan vertailuarvolla Qwen2.5-Math-PRM-7B suoriutui paremmin kuin enemmistöäänestys keskimäärin 1,4 prosentilla ja vastasi tai ylitti muut vastaavan kokoiset PRM-mallit. ProcessBenchissä Qwen2.5-Math-PRM-7B ylitti GPT-4o-0806:n ja kaikki avoimen lähdekoodin mallit, jääden jälkeen vain o1-ministä. Tiimi huomautti myös, että tulosarviointimalli Qwen2.5-Math-RM-72B osoitti yllättävää vaihevirheiden havaitsemiskykyä, ylittäen joidenkin PRM-mallien suorituskyvyn. Työn tavoitteena on parantaa prosessivalvontaa kielimallien päättelyssä.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset