Reasoning-Modelle brauchen eine neue Messmethode: Öffentliche Rangliste MERA Reason vorgestellt
Die MERA Reason Rangliste wurde eingeführt, um Reasoning-Modelle auf Russisch zu evaluieren. Sie umfasst vier Aufgabensets: Luzitania (Mathematik auf Olympiadeniveau), TMath (eine breite Palette von Problemen), MMReD (dichtes Kontext-Reasoning) und eine weitere Komponente, die noch folgt. Ziel ist es, die Fähigkeit eines Modells objektiv zu messen, Reasoning-Ketten aufzubauen, und nicht nur Wissen zu reproduzieren.
Т-Банк
Alibaba/Qwen
Habr — хаб ИИ24.07 · 11:01
