Alle jemals durchgeführten KI-Bewertungsergebnisse jetzt auf Hugging Face-Modellseiten
Hugging Face
Meta
Das EEE-Projekt (Every Eval Ever) und die Community-Evals-Plattform von Hugging Face haben ihre Kräfte gebündelt, um die Berichterstattung über KI-Bewertungen zu standardisieren. Entwickler können Ergebnisse nun in einem einheitlichen JSON-Format einreichen, und Modellseiten zeigen verifizierte Daten, die mit dem vollständigen Bewertungsprotokoll verknüpft sind.
Im Februar 2026 startete das Projekt EEE (Every Eval Ever) im Rahmen der Koalition EvalEval – der ersten organisationsübergreifenden Initiative zur Verbesserung der Berichterstattung über KI-Bewertungen. Gleichzeitig brachte Hugging Face Community Evals auf den Markt, um Benchmarks dezentral auf der Plattform abzubilden. Bisher waren die Evaluierungsergebnisse verstreut: Sie wurden in Artikeln, Bestenlisten, Blogs und Logs veröffentlicht, oft in unterschiedlichen Formaten, und dasselbe Modell konnte bei demselben Benchmark unterschiedliche Punktzahlen erzielen (z. B. erreichte LLaMA 65B 63,7 und 48,8 im MMLU) aufgrund undokumentierter Einstellungen. EEE führt ein einheitliches JSON-Schema zur Erfassung des Evaluierungsergebnisses ein, das Daten darüber enthält, wer die Evaluierung durchgeführt hat, welches Modell verwendet wurde, die Zugriffsmethode, die Generierungseinstellungen und eine Beschreibung der Metrik. Das EEE-Repository auf Hugging Face enthält bereits rund 229.000 Ergebnisse für über 22.000 Modelle und 2.200 Benchmarks, die aus 31 Berichtsformaten extrahiert wurden. Ein Konverter wandelt die EEE-Einträge nun automatisch in YAML-Dateien um, die von Hugging Face Community Evals benötigt werden, und sendet sie ab. Ergebnisse auf den Modellseiten erhalten von EvalEval ein verifiziertes Häkchen (verified checkmark), wenn die Daten über das offizielle Konto der Organisation gesendet wurden. Der Konverter gleicht die Felder ab, prüft vorhandene Ergebnisse und erstellt einen Pull Request erst nach Bestätigung durch den Benutzer. Unterstützt werden die Benchmarks MMLU-Pro, GPQA, HLE und GSM8K.
Quelle: Hugging Face blog —
Original
