MERA Reason:评估俄语推理模型的新公开排行榜
Т-Банк
Alibaba/Qwen
一个名为MERA Reason的新公开排行榜(作为MERA TEXT平台的一部分)已启动,专门评估AI模型在俄语数学和推理任务上的推理能力。它结合了四个不同的数据集:Luzitania(高难度奥数级数学)、TMath(多样化数学问题)、MMReD(密集上下文多跳推理),旨在为推理模型提供客观、可复现的基准。
MERA Reason排行榜的推出旨在解决大型语言模型推理能力客观测量的需求,尤其在俄语方面。该排行榜包含四个数据集:Luzitania(251道来自高级别奥林匹克竞赛的数学难题,经GPT-OSS-120B按难度筛选)、TMath(310道来自俄罗斯奥林匹克竞赛的题目,涉及代数、几何、组合数学等)和MMReD(一个用于密集上下文推理的合成基准测试,其中每个标记都相关)。该排行榜允许在可复现的环境中比较推理模型,并将作为MERA平台更大规模更新的一部分,预计今年夏天发布。
来源: Habr — хаб ИИ —
原文
