Alibaba Qwen julkaisee ProcessBench-vertailutyökalun ja parannettuja prosessipalkkiomalleja matemaattiseen päättelyyn
Alibaba/Qwen
OpenAI
Alibaba Qwen -tiimi on julkaissut avoimen lähdekoodin ProcessBench-vertailutyökalun, joka on tarkoitettu matemaattisten päättelyvaiheiden virheiden havaitsemiseen. Lisäksi tiimi on julkaissut kaksi uutta prosessipalkkiomallia (PRM), jotka perustuvat Qwen2.5-Math-malliin. Mallit ylittävät olemassa olevat avoimen lähdekoodin PRM-mallit ja osoittavat vahvaa virheidentifiointikykyä.
Alibaban Qwen-tiimi esitteli ProcessBenchin, vertailuarvon, joka sisältää 3 400 testitapausta kilpailu- ja olympiatason matematiikan ongelmista, joissa ihmisasiantuntijat merkitsevät varhaisimman virheellisen vaiheen vaiheittaisissa ratkaisuissa. He julkaisivat myös kaksi uutta prosessipalkkiomallia (PRM), Qwen2.5-Math-PRM-7B:n ja Qwen2.5-Math-PRM-72B:n, jotka on hienosäädetty Qwen2.5-Math-Instruct-malleista. Best-of-N-arvioinnissa (N=8) seitsemällä matematiikan vertailuarvolla Qwen2.5-Math-PRM-7B suoriutui paremmin kuin enemmistöäänestys keskimäärin 1,4 prosentilla ja vastasi tai ylitti muut vastaavan kokoiset PRM-mallit. ProcessBenchissä Qwen2.5-Math-PRM-7B ylitti GPT-4o-0806:n ja kaikki avoimen lähdekoodin mallit, jääden jälkeen vain o1-ministä. Tiimi huomautti myös, että tulosarviointimalli Qwen2.5-Math-RM-72B osoitti yllättävää vaihevirheiden havaitsemiskykyä, ylittäen joidenkin PRM-mallien suorituskyvyn. Työn tavoitteena on parantaa prosessivalvontaa kielimallien päättelyssä.
Lähde: Alibaba Qwen —
Alkuperäinen
