Alibaba Qwen ने प्रोसेसबेंच और गणितीय तर्क के लिए बेहतर प्रोसेस रिवार्ड मॉडल जारी किए
Alibaba/Qwen
OpenAI
Alibaba के Qwen टीम ने प्रोसेसबेंच (ProcessBench) को ओपन-सोर्स किया है, जो गणितीय तर्क के चरणों में त्रुटियों का पता लगाने के लिए एक बेंचमार्क है, और Qwen2.5-Math पर आधारित दो नए प्रोसेस रिवार्ड मॉडल (PRMs) जारी किए हैं। ये मॉडल मौजूदा ओपन-सोर्स PRMs से बेहतर प्रदर्शन करते हैं और मजबूत त्रुटि पहचान क्षमताएं दिखाते हैं।
अलीबाबा के Qwen टीम ने ProcessBench पेश किया, जो 3,400 परीक्षण मामलों वाला एक बेंचमार्क है, जो प्रतियोगिता और ओलंपियाड-स्तर के गणित के प्रश्नों पर केंद्रित है। इसमें मानव विशेषज्ञ चरण-दर-चरण समाधानों में सबसे पहले त्रुटिपूर्ण चरण को चिह्नित करते हैं। टीम ने दो नए प्रक्रिया पुरस्कार मॉडल (Process Reward Models - PRM) भी जारी किए: Qwen2.5-Math-PRM-7B और Qwen2.5-Math-PRM-72B, जिन्हें Qwen2.5-Math-Instruct मॉडल पर फाइन-ट्यून किया गया है। सात गणित बेंचमार्कों पर बेस्ट-ऑफ-एन (Best-of-N) मूल्यांकन (N=8) में, Qwen2.5-Math-PRM-7B ने बहुमत मतदान (majority voting) से औसतन 1.4% अधिक प्रदर्शन किया, और समान पैमाने के अन्य PRM के बराबर या उससे बेहतर रहा। ProcessBench पर, Qwen2.5-Math-PRM-7B ने GPT-4o-0806 और सभी ओपन-सोर्स मॉडलों को पीछे छोड़ दिया, केवल o1-mini से पीछे रहा। टीम ने यह भी नोट किया कि परिणाम पुरस्कार मॉडल (Outcome Reward Model) Qwen2.5-Math-RM-72B ने आश्चर्यजनक चरण-त्रुटि पहचान क्षमता दिखाई, जो कुछ PRM से बेहतर रहा। यह कार्य बड़े भाषा मॉडल (LLM) तर्क में प्रक्रिया पर्यवेक्षण (process supervision) को बेहतर बनाने के उद्देश्य से है।
स्रोत: Alibaba Qwen —
मूल
