Tous les résultats d'évaluation d'IA jamais réalisés sont désormais sur les pages de modèles Hugging Face
Hugging Face
Meta
Le projet EEE (Every Eval Ever) et la plateforme Community Evals de Hugging Face ont uni leurs forces pour normaliser le compte rendu des évaluations d'IA. Les développeurs peuvent désormais soumettre des résultats dans un format JSON unifié, et les pages de modèles affichent des données vérifiées liées au protocole d'évaluation complet.
En février 2026, le projet EEE (Every Eval Ever) a été lancé au sein de la coalition EvalEval, la première initiative inter-organisationnelle visant à améliorer la communication des résultats d'évaluation de l'IA. Parallèlement, Hugging Face a lancé Community Evals pour un affichage décentralisé des benchmarks sur la plateforme. Auparavant, les résultats d'évaluation étaient dispersés : publiés dans des articles, des tableaux de classement, des blogs et des journaux, souvent dans des formats différents, et un même modèle sur un même benchmark pouvait afficher des scores différents (par exemple, LLaMA 65B obtenait 63,7 et 48,8 sur MMLU) en raison de paramètres non documentés. EEE introduit un schéma JSON unifié pour enregistrer le résultat d'une évaluation, comprenant des données sur qui a effectué l'évaluation, quel modèle, le mode d'accès, les paramètres de génération et la description de la métrique. Le dépôt EEE sur Hugging Face contient déjà environ 229 000 résultats pour plus de 22 000 modèles et 2 200 benchmarks, extraits de 31 formats de rapports. Désormais, un convertisseur transforme automatiquement les enregistrements EEE en fichiers YAML requis par Hugging Face Community Evals et les envoie. Les résultats sur les pages des modèles reçoivent une coche de vérification (verified checkmark) de la part d'EvalEval si les données sont envoyées via le compte officiel de l'organisation. Le convertisseur fait correspondre les champs, vérifie les résultats existants et ne crée une pull request qu'après confirmation par l'utilisateur. Les benchmarks pris en charge sont MMLU-Pro, GPQA, HLE et GSM8K.
Source: Hugging Face blog —
original
