Reasoning-модели нужно измерять по-новому: представлен публичный лидерборд MERA Reason
Запущен лидерборд MERA Reason для оценки reasoning-моделей на русском языке. Он включает четыре набора задач: Luzitania (олимпиадная математика), TMath (широкий спектр задач), MMReD (рассуждения с плотным контекстом) и еще один предстоящий компонент. Цель — объективно измерить способность моделей строить цепочки рассуждений, а не просто воспроизводить знания.
Т-Банк
Alibaba/Qwen
Habr — хаб ИИ24.07 · 11:01

