शोधमॉडल 🇷🇺 24.07.2026 11:01

Reasoning Models Need a New Measurement: Public Leaderboard MERA Reason Unveiled

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
The MERA Reason leaderboard has been launched to evaluate reasoning models in Russian. It includes four task sets: Luzitania (olympiad-level mathematics), TMath (a wide range of problems), MMReD (dense context reasoning), and an upcoming component. The goal is to objectively measure a model's ability to build chains of reasoning, not just reproduce knowledge.
डेवलपर्स ने रूसी भाषा में रीज़निंग मॉडल का मूल्यांकन करने के लिए सार्वजनिक लीडरबोर्ड MERA Reason लॉन्च किया, जिसमें चार कार्य सेट शामिल हैं। पहला सेट, Luzitania, में 251 कठिन ओलंपियाड-स्तरीय गणितीय समस्याएं शामिल हैं, जिन्हें GPT-OSS-120B मॉडल की सहायता से कठिनाई के आधार पर फ़िल्टर किया गया है; ये समस्याएं रूसी में अनुवादित हैं और लंबी तर्क श्रृंखलाओं की आवश्यकता होती है। दूसरा सेट, TMath, में रूसी ओलंपियाड (अखिल-रूसी और मॉस्को) से 310 विभिन्न कठिनाई स्तरों वाली समस्याएं शामिल हैं, जिनमें कॉम्बिनेटरिक्स, संख्या सिद्धांत और ज्यामिति पर जोर दिया गया है; Qwen3-32B के लिए माध्य तर्क लंबाई लगभग 16 हज़ार टोकन है। तीसरा सेट, MMReD, एक सिंथेटिक बेंचमार्क है जो सघन संदर्भ में तर्क पर केंद्रित है: इसमें बाहरी उपकरणों के उपयोग के बिना संपूर्ण चरण अनुक्रम (128 चरणों तक) में जानकारी को एकत्रित करना आवश्यक है। लीडरबोर्ड टेक्स्ट-आधारित MERA के बड़े अपडेट का हिस्सा है और प्लेटफ़ॉर्म के अगले रिलीज़ के पूर्वावलोकन के रूप में कार्य करता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार