InvestigaciónModelos 🇷🇺 24.07.2026 11:01

Los Modelos de Razonamiento Necesitan una Nueva Medición: Se Revela el Ranking Público MERA Reason

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
Se ha lanzado el ranking MERA Reason para evaluar modelos de razonamiento en ruso. Incluye cuatro conjuntos de tareas: Luzitania (matemáticas a nivel de olimpiada), TMath (una amplia gama de problemas), MMReD (razonamiento en contexto denso) y un componente próximo. El objetivo es medir objetivamente la capacidad de un modelo para construir cadenas de razonamiento, no solo reproducir conocimientos.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (всероссийской и московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B — около 16К токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждение в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas