ForschungModelle 🇷🇺 24.07.2026 11:01

Reasoning-Modelle brauchen eine neue Messmethode: Öffentliche Rangliste MERA Reason vorgestellt

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
Die MERA Reason Rangliste wurde eingeführt, um Reasoning-Modelle auf Russisch zu evaluieren. Sie umfasst vier Aufgabensets: Luzitania (Mathematik auf Olympiadeniveau), TMath (eine breite Palette von Problemen), MMReD (dichtes Kontext-Reasoning) und eine weitere Komponente, die noch folgt. Ziel ist es, die Fähigkeit eines Modells objektiv zu messen, Reasoning-Ketten aufzubauen, und nicht nur Wissen zu reproduzieren.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (всероссийской и московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B — около 16К токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждение в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten