نماذج التفكير تحتاج إلى قياس جديد: إطلاق لوحة المتصدرين العامة MERA Reason
Т-Банк
Alibaba/Qwen
تم إطلاق لوحة المتصدرين MERA Reason لتقييم نماذج التفكير باللغة الروسية. تتضمن أربع مجموعات مهام: لوزيتانيا (رياضيات بمستوى الأولمبياد)، TMath (مجموعة واسعة من المسائل)، MMReD (تفكير كثيف السياق)، ومكون قادم. الهدف هو قياس قدرة النموذج على بناء سلاسل تفكير بشكل موضوعي، وليس فقط إعادة إنتاج المعرفة.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач различной сложности из российских олимпиад (всероссийской и московской) с упором на комбинаторику, теорию чисел и геометрию; медианная длина рассуждений у Qwen3-32B — около 16К токенов. Третий набор, MMReD, — синтетический бенчмарк на рассуждение в плотном контексте: требуется агрегировать информацию по всей последовательности шагов (до 128 шагов) без использования внешних инструментов. Лидерборд является частью большого обновления текстовой MERA и служит превью следующего релиза платформы.
المصدر: Habr — хаб ИИ —
الأصلي
