推理模型需要新的衡量标准:公共排行榜MERA Reason发布
Т-Банк
Alibaba/Qwen
MERA Reason排行榜已发布,用于评估俄语推理模型。它包括四个任务集:Luzitania(奥林匹克水平数学)、TMath(广泛问题)、MMReD(密集上下文推理)以及一个即将推出的组件。目标是客观衡量模型构建推理链的能力,而不仅仅是复现知识。
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (всероссийской и московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B — около 16К токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждение в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
来源: Habr — хаб ИИ —
原文
