MERA Reason : nouveau classement public pour évaluer les modèles de raisonnement en russe
Т-Банк
Alibaba/Qwen
Un nouveau classement public appelé MERA Reason (faisant partie de la plateforme MERA TEXT) a été lancé pour évaluer les capacités de raisonnement des modèles d'intelligence artificielle sur des tâches mathématiques et de raisonnement spécifiquement en langue russe. Il combine quatre ensembles de données distincts : Luzitania (problèmes mathématiques de niveau olympiade difficile), TMath (problèmes mathématiques variés), MMReD (raisonnement multi-étapes à contexte dense) et vise à fournir un benchmark objectif et reproductible pour les modèles de raisonnement.
Le classement MERA Reason a été introduit pour répondre au besoin de mesure objective du raisonnement dans les grands modèles de langage, en particulier pour la langue russe. Il comprend quatre ensembles de données : Luzitania (251 problèmes mathématiques difficiles issus d'olympiades de haut niveau, filtrés par difficulté à l'aide de GPT-OSS-120B), TMath (310 problèmes d'olympiades russes couvrant l'algèbre, la géométrie, la combinatoire, etc.), et MMReD (un benchmark synthétique pour le raisonnement en contexte dense où chaque token est pertinent). Le classement permet la comparaison de modèles de raisonnement dans un environnement reproductible et fera partie d'une mise à jour plus large de la plateforme MERA prévue pour cet été.
Source: Habr — хаб ИИ —
original
