MERA Reason: Novo Ranking Público para Avaliar Modelos de Raciocínio em Russo
Т-Банк
Alibaba/Qwen
Um novo ranking público chamado MERA Reason (parte da plataforma MERA TEXT) foi lançado para avaliar as capacidades de raciocínio de modelos de inteligência artificial especificamente em tarefas matemáticas e de raciocínio em língua russa. Ele combina quatro conjuntos de dados distintos: Luzitania (problemas matemáticos difíceis de nível olímpico), TMath (diversos problemas matemáticos), MMReD (raciocínio de múltiplos saltos com contexto denso) e visa fornecer um benchmark objetivo e reproduzível para modelos de raciocínio.
O ranking MERA Reason foi introduzido para atender à necessidade de medição objetiva do raciocínio em grandes modelos de linguagem, especialmente para o idioma russo. Ele é composto por quatro conjuntos de dados: Luzitania (251 problemas difíceis de matemática de olimpíadas de alto nível, filtrados por dificuldade usando GPT-OSS-120B), TMath (310 problemas de olimpíadas russas cobrindo álgebra, geometria, combinatória, etc.) e MMReD (um benchmark sintético para raciocínio em contexto denso, onde cada token é relevante). O ranking permite a comparação de modelos de raciocínio em um ambiente reprodutível e fará parte de uma atualização maior da plataforma MERA, prevista para este verão.
Fonte: Habr — хаб ИИ —
original
