ИсследованияМодели 🇷🇺 24.07.2026 11:01

Reasoning-модели нужно измерять по-новому: представлен публичный лидерборд MERA Reason

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
Запущен лидерборд MERA Reason для оценки reasoning-моделей на русском языке. Он включает четыре набора задач: Luzitania (олимпиадная математика), TMath (широкий спектр задач), MMReD (рассуждения с плотным контекстом) и еще один предстоящий компонент. Цель — объективно измерить способность моделей строить цепочки рассуждений, а не просто воспроизводить знания.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач
Показать ещё ↓
Сокращения
GPU = Graphics Processing Unit — графический процессор
JSON = JavaScript Object Notation — текстовый формат обмена данными
MCQ = Multiple Choice Question — вопрос с множественным выбором
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости