मॉडलशोध 🇨🇳 28.07.2026 16:03

एलिबाबा क्वेन ने गणितीय तर्क के लिए प्रोसेसबेंच और बेहतर प्रोसेस रिवॉर्ड मॉडल जारी किए

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
एलिबाबा के क्वेन टीम ने प्रोसेसबेंच (ProcessBench) को ओपन-सोर्स किया है, जो गणितीय तर्क के चरणों में त्रुटियों का पता लगाने के लिए एक बेंचमार्क है, और क्वेन2.5-मैथ (Qwen2.5-Math) पर आधारित दो नए प्रोसेस रिवॉर्ड मॉडल (PRMs) जारी किए हैं। ये मॉडल मौजूदा ओपन-सोर्स PRMs से बेहतर प्रदर्शन करते हैं और मजबूत त्रुटि पहचान क्षमताएँ दिखाते हैं।
अलीबाबा के Qwen टीम ने ProcessBench पेश किया, जो 3,400 परीक्षण मामलों वाला एक बेंचमार्क है, जो प्रतियोगिता और ओलंपियाड-स्तर के गणित के प्रश्नों पर केंद्रित है। इसमें मानव विशेषज्ञ चरण-दर-चरण समाधानों में सबसे पहले त्रुटिपूर्ण चरण को चिह्नित करते हैं। टीम ने दो नए प्रक्रिया पुरस्कार मॉडल (Process Reward Models - PRM) भी जारी किए: Qwen2.5-Math-PRM-7B और Qwen2.5-Math-PRM-72B, जिन्हें Qwen2.5-Math-Instruct मॉडल पर फाइन-ट्यून किया गया है। सात गणित बेंचमार्कों पर बेस्ट-ऑफ-एन (Best-of-N) मूल्यांकन (N=8) में, Qwen2.5-Math-PRM-7B ने बहुमत मतदान (majority voting) से औसतन 1.4% अधिक प्रदर्शन किया, और समान पैमाने के अन्य PRM के बराबर या उससे बेहतर रहा। ProcessBench पर, Qwen2.5-Math-PRM-7B ने GPT-4o-0806 और सभी ओपन-सोर्स मॉडलों को पीछे छोड़ दिया, केवल o1-mini से पीछे रहा। टीम ने यह भी नोट किया कि परिणाम पुरस्कार मॉडल (Outcome Reward Model) Qwen2.5-Math-RM-72B ने आश्चर्यजनक चरण-त्रुटि पहचान क्षमता दिखाई, जो कुछ PRM से बेहतर रहा। यह कार्य बड़े भाषा मॉडल (LLM) तर्क में प्रक्रिया पर्यवेक्षण (process supervision) को बेहतर बनाने के उद्देश्य से है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार