Semua Hasil Eval Kini Tersedia di Halaman Model Hugging Face
Hugging Face
Meta
Proyek EEE (Every Eval Ever), yang diluncurkan oleh Koalisi EvalEval, menstandarisasi pelaporan evaluasi AI menggunakan skema JSON terpadu. Kini terintegrasi dengan Hugging Face Community Evals, hal ini memungkinkan tautan silang antara halaman model dan catatan evaluasi lengkap, dengan lebih dari 229.000 hasil dari 31 format yang telah dikumpulkan.
Proyek EEE (Every Eval Ever), yang diluncurkan pada Februari 2026 oleh Koalisi EvalEval, bertujuan untuk menstandarisasi pelaporan evaluasi AI di seluruh evaluator pihak pertama dan pihak ketiga. Proyek ini menggunakan skema JSON terpadu yang mencatat siapa yang menjalankan evaluasi, model mana, bagaimana aksesnya, pengaturan generasi, definisi metrik, dan output per sampel opsional. Pada waktu yang sama, Hugging Face meluncurkan Community Evals untuk mendesentralisasi pelaporan skor benchmark di Hub. Keduanya kini telah terintegrasi: kontributor dapat mengirim hasil EEE ke Hugging Face Community Evals melalui konverter yang mengubah catatan JSON ke format YAML yang diharapkan oleh Hugging Face. Skor yang dihasilkan muncul di halaman model dengan lencana yang menautkan kembali ke catatan EEE lengkap, termasuk konfigurasi generasi, versi harness, dan catatan reprodusibilitas. Penyimpanan data EEE di Hugging Face telah berkembang menjadi sekitar 229.000 hasil evaluasi di lebih dari 22.000 model dan 2.200 benchmark, yang berasal dari 31 format pelaporan berbeda. Mereproduksi semua pengujian ini dari awal akan memakan biaya ratusan ribu dolar, menyoroti nilai pelaporan terpusat. Konverter saat ini mendukung empat benchmark resmi: MMLU-Pro, GPQA, HLE, dan GSM8K. Pengguna dapat mengirim catatan EEE mereka ke penyimpanan data, lalu menjalankan konverter untuk menghasilkan pratinjau YAML dan membuka pull request setelah ditinjau.
Sumber: Hugging Face blog —
asli
