PesquisaModelos 🇷🇺 24.07.2026 11:01

Modelos de Raciocínio Precisam de uma Nova Medição: Lançado o Ranking Público MERA Reason

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
O ranking MERA Reason foi lançado para avaliar modelos de raciocínio em russo. Ele inclui quatro conjuntos de tarefas: Luzitania (matemática de nível olímpico), TMath (uma ampla variedade de problemas), MMReD (raciocínio com contexto denso) e um componente futuro. O objetivo é medir objetivamente a capacidade de um modelo de construir cadeias de raciocínio, não apenas reproduzir conhecimento.
Desenvolvedores lançaram o ranking público MERA Reason para avaliar modelos de raciocínio em língua russa, composto por quatro conjuntos de tarefas. O primeiro conjunto, Luzitania, inclui 251 problemas matemáticos complexos de nível olímpico, filtrados por dificuldade usando o modelo GPT-OSS-120B; os problemas foram traduzidos para o russo e exigem longas cadeias de raciocínio. O segundo conjunto, TMath, contém 310 problemas de dificuldades variadas de olimpíadas russas (nacional e de Moscou), com foco em combinatória, teoria dos números e geometria; a mediana do comprimento do raciocínio para o Qwen3-32B é de cerca de 16 mil tokens. O terceiro conjunto, MMReD, é um benchmark sintético para raciocínio em contexto denso: requer agregar informações ao longo de toda a sequência de passos (até 128 passos) sem uso de ferramentas externas. O ranking faz parte de uma grande atualização do MERA textual e serve como prévia do próximo lançamento da plataforma.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas