TutkimusMallit 🇷🇺 24.07.2026 11:01

Päättelymallit tarvitsevat uuden mittarin: Julkinen MERA Reason -listaus julkistettu

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
MERA Reason -listaus on julkaistu arvioimaan päättelymalleja venäjäksi. Se sisältää neljä tehtäväjoukkoa: Luzitania (olympiatason matematiikka), TMath (laaja valikoima ongelmia), MMReD (tiheä kontekstipäättely) ja tuleva komponentti. Tavoitteena on objektiivisesti mitata mallin kykyä rakentaa päättelyketjuja, ei pelkästään toistaa tietoa.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (всероссийской и московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B — около 16К токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждение в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset