MERA Reason: Neue öffentliche Bestenliste zur Bewertung von Reasoning-Modellen auf Russisch
Т-Банк
Alibaba/Qwen
Eine neue öffentliche Bestenliste namens MERA Reason (Teil der MERA TEXT-Plattform) wurde gestartet, um die Reasoning-Fähigkeiten von KI-Modellen speziell für russischsprachige mathematische und reasoning-basierte Aufgaben zu bewerten. Sie kombiniert vier verschiedene Datensätze: Luzitania (harte Olympiade-Level-Mathematik), TMath (vielfältige Mathematikprobleme), MMReD (dicht kontextuelles Multi-Hop-Reasoning) und zielt darauf ab, eine objektive, reproduzierbare Benchmark für Reasoning-Modelle bereitzustellen.
Das MERA Reason Leaderboard wurde eingeführt, um den Bedarf an objektiver Messung der logischen Schlussfolgerung in großen Sprachmodellen zu decken, insbesondere für die russische Sprache. Es umfasst vier Datensätze: Luzitania (251 schwierige Mathematikaufgaben aus hochrangigen Olympiaden, gefiltert nach Schwierigkeitsgrad mit GPT-OSS-120B), TMath (310 Aufgaben aus russischen Olympiaden zu Algebra, Geometrie, Kombinatorik und mehr) sowie MMReD (eine synthetische Benchmark für dichte Kontextschlussfolgerung, bei der jedes Token relevant ist). Das Leaderboard ermöglicht den Vergleich von Reasoning-Modellen in einer reproduzierbaren Umgebung und wird Teil eines größeren Updates der MERA-Plattform sein, das für diesen Sommer erwartet wird.
Quelle: Habr — хаб ИИ —
Original
