RechercheModèles 🇷🇺 24.07.2026 11:01

Les modèles de raisonnement ont besoin d'une nouvelle mesure : le classement public MERA Reason dévoilé

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
Le classement MERA Reason a été lancé pour évaluer les modèles de raisonnement en russe. Il comprend quatre ensembles de tâches : Luzitania (mathématiques de niveau olympiade), TMath (un large éventail de problèmes), MMReD (raisonnement contextuel dense) et un composant à venir. L'objectif est de mesurer objectivement la capacité d'un modèle à construire des chaînes de raisonnement, pas seulement à reproduire des connaissances.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (всероссийской и московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B — около 16К токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждение в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches