Alle AI-evaluatieresultaten ooit uitgevoerd staan nu op Hugging Face-modelpagina's
Hugging Face
Meta
Het EEE-project (Every Eval Ever) en het Community Evals-platform van Hugging Face hebben hun krachten gebundeld om de rapportage van AI-evaluaties te standaardiseren. Ontwikkelaars kunnen nu resultaten indienen in een uniform JSON-formaat, en modelpagina's tonen geverifieerde gegevens die zijn gekoppeld aan het volledige evaluatieprotocol.
In februari 2026 startte het project EEE (Every Eval Ever) binnen de coalitie EvalEval, het eerste interorganisationele initiatief om de rapportage van AI-evaluaties te verbeteren. Tegelijkertijd lanceerde Hugging Face Community Evals voor decentrale weergave van benchmarks op het platform. Eerder waren evaluatieresultaten versnipperd: ze werden gepubliceerd in artikelen, leaderboards, blogs en logs, vaak in verschillende formaten, en hetzelfde model op dezelfde benchmark kon verschillende scores laten zien (bijvoorbeeld LLaMA 65B kreeg 63,7 en 48,8 op MMLU) vanwege niet-gedocumenteerde instellingen. EEE introduceert een uniform JSON-schema voor het vastleggen van evaluatieresultaten, met gegevens over wie de evaluatie uitvoerde, welk model, toegangsmethode, generatie-instellingen en beschrijving van de metriek. De EEE-repository op Hugging Face bevat al ongeveer 229.000 resultaten voor meer dan 22.000 modellen en 2.200 benchmarks, geëxtraheerd uit 31 rapportformaten. Nu converteert een convertor automatisch EEE-records naar YAML-bestanden die vereist zijn voor Hugging Face Community Evals en stuurt deze door. Resultaten op modelpagina's krijgen een geverifieerd vinkje (verified checkmark) van EvalEval als de gegevens zijn ingediend via een officieel organisatieaccount. De convertor vergelijkt velden, controleert bestaande resultaten en maakt pas een 'pull request' aan na bevestiging door de gebruiker. Ondersteunde benchmarks zijn MMLU-Pro, GPQA, HLE en GSM8K.
Bron: Hugging Face blog —
origineel
