Исследования 🇷🇺 24.07.2026 11:01

MERA Reason: новый публичный рейтинг для оценки рассуждающих моделей на русском языке

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
Запущен новый публичный рейтинг MERA Reason (часть платформы MERA TEXT) для оценки способности ИИ-моделей к рассуждению на русскоязычных математических и логических задачах. Он объединяет четыре набора данных: Luzitania (сложные олимпиадные задачи), TMath (разнообразные математические задачи), MMReD (многошаговые рассуждения с плотным контекстом) и нацелен на создание объективного и воспроизводимого бенчмарка для моделей рассуждения.
Лидерборд MERA Reason был представлен для решения задачи объективного измерения способности к рассуждению в больших языковых моделях, особенно для русского языка. Он включает четыре набора данных: Luzitania (251 сложная математическая задача из олимпиад высокого уровня, отфильтрованная по сложности с помощью GPT-OSS-120B), TMath (310 задач из российских олимпиад, охватывающих алгебру, геометрию,
Показать ещё ↓
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости