MERA Reason: रूसी भाषा में तर्क मॉडल के मूल्यांकन के लिए नया सार्वजनिक लीडरबोर्ड
Т-Банк
Alibaba/Qwen
MERA TEXT प्लेटफॉर्म के भाग के रूप में MERA Reason नामक एक नया सार्वजनिक लीडरबोर्ड लॉन्च किया गया है, जो विशेष रूप से रूसी भाषा के गणितीय और तर्क कार्यों पर एआई मॉडल की तर्क क्षमताओं का मूल्यांकन करता है। यह चार अलग-अलग डेटासेट को जोड़ता है: Luzitania (कठिन ओलंपियाड-स्तरीय गणित), TMath (विविध गणित समस्याएं), MMReD (सघन-संदर्भ बहु-चरणीय तर्क), और तर्क मॉडल के लिए एक उद्देश्यपूर्ण, पुनरुत्पादनीय बेंचमार्क प्रदान करने का लक्ष्य रखता है।
MERA Reason लीडरबोर्ड को बड़े भाषा मॉडलों में तर्कशक्ति के वस्तुनिष्ठ मापन की आवश्यकता को पूरा करने के लिए पेश किया गया है, विशेष रूप से रूसी भाषा के लिए। इसमें चार डेटासेट शामिल हैं: Luzitania (उच्च स्तरीय ओलंपियाडों की 251 कठिन गणित समस्याएं, GPT-OSS-120B का उपयोग करके कठिनाई के आधार पर फ़िल्टर की गईं), TMath (रूसी ओलंपियाडों की 310 समस्याएं जो बीजगणित, ज्यामिति, कॉम्बिनेटरिक्स आदि को कवर करती हैं), और MMReD (सघन-संदर्भ तर्कशक्ति के लिए एक सिंथेटिक बेंचमार्क जहां हर टोकन प्रासंगिक है)। यह लीडरबोर्ड तर्क मॉडलों की तुलना प्रतिलिपि-सक्षम वातावरण में करने की अनुमति देता है और इस गर्मी में अपेक्षित MERA प्लेटफ़ॉर्म के एक बड़े अपडेट का हिस्सा होगा।
स्रोत: Habr — хаб ИИ —
मूल
