Los Modelos de Razonamiento Necesitan una Nueva Medición: Se Revela el Ranking Público MERA Reason
Se ha lanzado el ranking MERA Reason para evaluar modelos de razonamiento en ruso. Incluye cuatro conjuntos de tareas: Luzitania (matemáticas a nivel de olimpiada), TMath (una amplia gama de problemas), MMReD (razonamiento en contexto denso) y un componente próximo. El objetivo es medir objetivamente la capacidad de un modelo para construir cadenas de razonamiento, no solo reproducir conocimientos.
Т-Банк
Alibaba/Qwen
Habr — хаб ИИ24.07 · 11:01
