연구모델 🇷🇺 24.07.2026 11:01

Reasoning Models Need a New Measurement: Public Leaderboard MERA Reason Unveiled

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
The MERA Reason leaderboard has been launched to evaluate reasoning models in Russian. It includes four task sets: Luzitania (olympiad-level mathematics), TMath (a wide range of problems), MMReD (dense context reasoning), and an upcoming component. The goal is to objectively measure a model's ability to build chains of reasoning, not just reproduce knowledge.
Разработчики запустили публичный лидерборд MERA Reason для оценки моделей рассуждений (reasoning) на русском языке, который состоит из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по сложности с помощью модели GPT-OSS-120B; задачи переведены на русский язык и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (Всероссийской и Московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B составляет около 16 тысяч токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждения в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스