MERA Reason: nuevo ranking público para evaluar modelos de razonamiento en ruso
Т-Банк
Alibaba/Qwen
Se ha lanzado un nuevo ranking público llamado MERA Reason (parte de la plataforma MERA TEXT) para evaluar las capacidades de razonamiento de los modelos de inteligencia artificial específicamente en tareas matemáticas y de razonamiento en idioma ruso. Combina cuatro conjuntos de datos distintos: Luzitania (problemas de matemáticas de nivel olímpico difíciles), TMath (problemas matemáticos diversos), MMReD (razonamiento de múltiples pasos con contexto denso) y tiene como objetivo proporcionar un punto de referencia objetivo y reproducible para modelos de razonamiento.
La tabla clasificatoria MERA Reasoning ha sido presentada para abordar la necesidad de una medición objetiva del razonamiento en modelos de lenguaje extensos, especialmente para el idioma ruso. Comprende cuatro conjuntos de datos: Luzitania (251 problemas matemáticos difíciles de olimpiadas de alto nivel, filtrados por dificultad mediante GPT-OSS-120B), TMath (310 problemas de olimpiadas rusas que abarcan álgebra, geometría, combinatoria, etc.), y MMReD (un banco de pruebas sintético para razonamiento en contexto denso, donde cada token es relevante). La tabla clasificatoria permite la comparación de modelos de razonamiento en un entorno reproducible y formará parte de una actualización más amplia de la plataforma MERA que se espera para este verano.
Fuente: Habr — хаб ИИ —
original
