Jeder Eval Ever Ergebnisse jetzt auf Hugging Face Modellseiten
Hugging Face
Meta
Das EEE (Every Eval Ever)-Projekt, gestartet von der EvalEval Coalition, standardisiert die Berichterstattung über KI-Bewertungen mithilfe eines einheitlichen JSON-Schemas. Es ist jetzt in die Hugging Face Community Evals integriert und ermöglicht Querverweise zwischen Modellseiten und vollständigen Bewertungsdatensätzen. Bereits über 229.000 Ergebnisse aus 31 Formaten wurden gesammelt.
Das Projekt EEE (Every Eval Ever), das im Februar 2026 von der EvalEval Coalition ins Leben gerufen wurde, zielt darauf ab, die KI-Evaluierungsberichterstattung bei Erst- und Drittanbietern zu standardisieren. Es verwendet ein einheitliches JSON-Schema, das erfasst, wer die Evaluierung durchgeführt hat, welches Modell bewertet wurde, wie darauf zugegriffen wurde, die Generierungseinstellungen, die Metrikdefinitionen und optionale Ausgaben pro Stichprobe. Hugging Face hat gleichzeitig Community Evals veröffentlicht, um die Berichterstattung über Benchmark-Scores auf dem Hub zu dezentralisieren. Beide sind nun integriert: Beitragende können EEE-Ergebnisse über einen Konverter, der JSON-Datensätze in das von Hugging Face erwartete YAML-Format umwandelt, an Hugging Face Community Evals senden. Die resultierenden Scores erscheinen auf Modellseiten mit einem Badge, das auf den vollständigen EEE-Datensatz verweist, einschließlich Generierungskonfiguration, Harness-Version und Reproduzierbarkeitsnotizen. Der EEE-Datenspeicher auf Hugging Face ist auf etwa 229.000 Evaluierungsergebnisse über 22.000 Modelle und 2.200 Benchmarks angewachsen, die aus 31 verschiedenen Berichtsformaten stammen. Die Reproduktion dieser Läufe von Grund auf würde Hunderttausende von Dollar kosten, was den Wert einer zentralisierten Berichterstattung unterstreicht. Der Konverter unterstützt derzeit vier offizielle Benchmarks: MMLU-Pro, GPQA, HLE und GSM8K. Benutzer können ihre EEE-Datensätze an den Datenspeicher senden, dann den Konverter ausführen, um YAML-Vorschauen zu generieren und nach einer Überprüfung Pull Requests zu öffnen.
Quelle: Hugging Face blog —
Original
