Reasoning-модели нужно измерять по-новому: представлен публичный лидерборд MERA Reason
Т-Банк
Alibaba/Qwen
Запущен лидерборд MERA Reason для оценки reasoning-моделей на русском языке. Он включает четыре набора задач: Luzitania (олимпиадная математика), TMath (широкий спектр задач), MMReD (рассуждения с плотным контекстом) и еще один предстоящий компонент. Цель — объективно измерить способность моделей строить цепочки рассуждений, а не просто воспроизводить знания.
Разработчики запустили публичный лидерборд MERA Reason для оценки reasoning-моделей на русском языке, состоящий из четырёх наборов задач. Первый набор, Luzitania, включает 251 сложную математическую задачу олимпиадного уровня, отфильтрованную по трудности с помощью модели GPT-OSS-120B; задачи переведены на русский и требуют длинных цепочек рассуждений. Второй набор, TMath, содержит 310 задач
Показать ещё ↓
- Сокращения
- GPU = Graphics Processing Unit — графический процессор
- JSON = JavaScript Object Notation — текстовый формат обмена данными
- MCQ = Multiple Choice Question — вопрос с множественным выбором
Источник: Habr — хаб ИИ —
оригинал
