OnderzoekModellen 🇷🇺 24.07.2026 11:01

Redenerende modellen hebben een nieuwe meting nodig: publieke ranglijst MERA Reason onthuld

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
De MERA Reason-ranglijst is gelanceerd om redenerende modellen in het Russisch te evalueren. Het bevat vier taakgroepen: Luzitania (wiskunde op olympiadeniveau), TMath (een breed scala aan problemen), MMReD (redeneren met dichte context) en een aanstaand onderdeel. Het doel is om objectief het vermogen van een model te meten om redeneerketens op te bouwen, niet alleen kennis te reproduceren.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (всероссийской и московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B — около 16К токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждение в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws