Kaikki koskaan tehdyt tekoälyarvioinnit ovat nyt Hugging Face -mallisivuilla
Hugging Face
Meta
EEE (Every Eval Ever) -projekti ja Hugging Facen Community Evals -alusta ovat yhdistäneet voimansa standardoidakseen tekoälyarviointien raportoinnin. Kehittäjät voivat nyt lähettää tuloksia yhtenäisessä JSON-muodossa, ja mallisivuilla näkyvät vahvistetut tiedot, jotka on linkitetty täydelliseen arviointiprotokollaan.
Helmikuussa 2026 käynnistyi EEE-projekti (Every Eval Ever) osana EvalEval-koalitiota – ensimmäistä organisaatioiden välistä aloitetta tekoälyn arviointien raportoinnin parantamiseksi. Samanaikaisesti Hugging Face julkaisi Community Evals -toiminnon bäkkärien hajautettua esittämistä varten alustallaan. Aiemmin arviointitulokset olivat hajanaisia: ne julkaistiin artikkeleissa, listataulukoissa, blogeissa ja lokitiedoissa, usein eri formaateissa, ja sama malli saattoi saada eri pisteitä samasta bäkkäristä (esimerkiksi LLaMA 65B sai 63,7 ja 48,8 MMLU:sta) dokumentoimattomien asetusten vuoksi. EEE ottaa käyttöön yhtenäisen JSON-skeeman arviointituloksen tallentamiseen, sisältäen tiedot siitä, kuka suoritti arvioinnin, mikä malli, pääsytapa, generointiasetukset ja metrikka kuvaus. EEE-repositoriossa Hugging Facessa on jo noin 229 000 tulosta yli 22 000 mallille ja 2 200 bäkkäristä, jotka on poimittu 31 raporttiformaatista. Nyt muunnin muuntaa automaattisesti EEE-tietueet YAML-tiedostoiksi, joita Hugging Face Community Evals edellyttää, ja lähettää ne. Mallien sivuilla olevat tulokset saavat EvalEvalin vahvistusmerkin (verified checkmark), jos tiedot on lähetetty organisaation virallisen tilin kautta. Muunnin vertaa kenttiä, tarkistaa olemassa olevat tulokset ja luo pull requestin vasta käyttäjän vahvistuksen jälkeen. Tuettuja bäkkäreitä ovat MMLU-Pro, GPQA, HLE ja GSM8K.
Lähde: Hugging Face blog —
Alkuperäinen
