Tutkimus 🇺🇸 27.07.2026 09:06

Jokaisen arvioinnin tulokset nyt Hugging Face -mallisivuilla

Hugging FaceHugging Face MetaMeta
EEE (Every Eval Ever) -projekti, jonka EvalEval Coalition käynnisti, standardoi tekoälyn arviointiraportointia yhtenäisen JSON-skeeman avulla. Se on nyt integroitu Hugging Face Community Evals -järjestelmään, mikä mahdollistaa ristiinlinkityksen mallisivujen ja täydellisten arviointitietueiden välillä. Sen avulla on kerätty jo yli 229 000 tulosta 31 eri formaatista.
Helmikuussa 2026 EvalEval-koalition lanseeraama EEE (Every Eval Ever) -projekti pyrkii standardoimaan tekoälyn arviointiraportointia sekä ensimmäisen että kolmannen osapuolen arvioijien kesken. Se käyttää yhtenäistä JSON-skeemaa, joka tallentaa tiedot arvioinnin suorittajasta, mallista, käyttötavasta, generointiasetuksista, mittarimääritelmistä ja valinnaisista näytekohtaisista tulosteista. Samanaikaisesti Hugging Face lanseerasi Community Evals -palvelun hajauttaakseen vertailuarvojen pisteytysraportointia alustallaan. Nämä kaksi on nyt yhdistetty: osallistujat voivat lähettää EEE-tuloksia Hugging Face Community Evalsiin muuntimen avulla, joka muuntaa JSON-tietueet Hugging Facen edellyttämään YAML-muotoon. Tulokset näkyvät mallisivuilla merkillä, joka linkittää takaisin koko EEE-tietueeseen, mukaan lukien generointiasetukset, valjaiden versio ja toistettavuustiedot. EEE-tietovarasto Hugging Facessa on kasvanut noin 229 000 arviointitulokseen yli 22 000 mallista ja 2 200 vertailuarvosta, jotka on koottu 31 eri raportointimuodosta. Näiden ajojen toistaminen alusta alkaen maksaisi satoja tuhansia dollareita, mikä korostaa keskitetyn raportoinnin arvoa. Muunnin tukee tällä hetkellä neljää virallista vertailuarvoa: MMLU-Pro, GPQA, HLE ja GSM8K. Käyttäjät voivat lähettää EEE-tietueensa tietovarastoon, ajaa sitten muuntimen YAML-esikatselujen luomiseksi ja avata vetopyyntöjä tarkastuksen jälkeen.
Lähde: Hugging Face blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset