Onderzoek 🇷🇺 24.07.2026 11:01

MERA Reason: Nieuw openbaar klassement voor het evalueren van redeneermodellen in het Russisch

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
Er is een nieuw openbaar klassement gelanceerd, genaamd MERA Reason (onderdeel van het MERA TEXT-platform), dat de redeneervaardigheden van AI-modollen evalueert op Russischtalige wiskundige en redeneertaken. Het combineert vier verschillende datasets: Luzitania (moeilijke olympiade-wiskunde), TMath (diverse wiskundeproblemen), MMReD (multi-hop redeneren met dichte context) en streeft naar een objectieve, reproduceerbare benchmark voor redeneermodellen.
De MERA Reason-leaderboard is geïntroduceerd om tegemoet te komen aan de behoefte aan objectieve meting van redeneren in grote taalmodellen, met name voor de Russische taal. Deze omvat vier datasets: Luzitania (251 lastige wiskundeproblemen van hoogwaardige olympiades, gefilterd op moeilijkheidsgraad met behulp van GPT-OSS-120B), TMath (310 problemen van Russische olympiades, die algebra, meetkunde, combinatoriek en dergelijke bestrijken) en MMReD (een synthetische benchmark voor redeneren in dichte context, waarbij elk token relevant is). De leaderboard maakt het mogelijk om redeneermodellen in een reproduceerbare omgeving te vergelijken en zal deel uitmaken van een grotere update van het MERA-platform, die deze zomer wordt verwacht.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws