मॉडलशोध 🇨🇳 28.07.2026 16:03

Alibaba Qwen ने प्रोसेसबेंच और गणितीय तर्क के लिए बेहतर प्रोसेस रिवार्ड मॉडल जारी किए

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Alibaba के Qwen टीम ने प्रोसेसबेंच (ProcessBench) को ओपन-सोर्स किया है, जो गणितीय तर्क के चरणों में त्रुटियों का पता लगाने के लिए एक बेंचमार्क है, और Qwen2.5-Math पर आधारित दो नए प्रोसेस रिवार्ड मॉडल (PRMs) जारी किए हैं। ये मॉडल मौजूदा ओपन-सोर्स PRMs से बेहतर प्रदर्शन करते हैं और मजबूत त्रुटि पहचान क्षमताएं दिखाते हैं।
अलीबाबा के Qwen टीम ने ProcessBench पेश किया, जो 3,400 परीक्षण मामलों वाला एक बेंचमार्क है, जो प्रतियोगिता और ओलंपियाड-स्तर के गणित के प्रश्नों पर केंद्रित है। इसमें मानव विशेषज्ञ चरण-दर-चरण समाधानों में सबसे पहले त्रुटिपूर्ण चरण को चिह्नित करते हैं। टीम ने दो नए प्रक्रिया पुरस्कार मॉडल (Process Reward Models - PRM) भी जारी किए: Qwen2.5-Math-PRM-7B और Qwen2.5-Math-PRM-72B, जिन्हें Qwen2.5-Math-Instruct मॉडल पर फाइन-ट्यून किया गया है। सात गणित बेंचमार्कों पर बेस्ट-ऑफ-एन (Best-of-N) मूल्यांकन (N=8) में, Qwen2.5-Math-PRM-7B ने बहुमत मतदान (majority voting) से औसतन 1.4% अधिक प्रदर्शन किया, और समान पैमाने के अन्य PRM के बराबर या उससे बेहतर रहा। ProcessBench पर, Qwen2.5-Math-PRM-7B ने GPT-4o-0806 और सभी ओपन-सोर्स मॉडलों को पीछे छोड़ दिया, केवल o1-mini से पीछे रहा। टीम ने यह भी नोट किया कि परिणाम पुरस्कार मॉडल (Outcome Reward Model) Qwen2.5-Math-RM-72B ने आश्चर्यजनक चरण-त्रुटि पहचान क्षमता दिखाई, जो कुछ PRM से बेहतर रहा। यह कार्य बड़े भाषा मॉडल (LLM) तर्क में प्रक्रिया पर्यवेक्षण (process supervision) को बेहतर बनाने के उद्देश्य से है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार