Resultados de Todos os Evals Agora nas Páginas de Modelos do Hugging Face
Hugging Face
Meta
O projeto EEE (Every Eval Ever), lançado pela Coalizão EvalEval, padroniza a divulgação de avaliações de IA usando um esquema JSON unificado. Agora integrado com os Community Evals do Hugging Face, ele permite vinculação cruzada entre páginas de modelos e registros completos de avaliação, com mais de 229.000 resultados de 31 formatos já coletados.
O projeto EEE (Every Eval Ever), lançado em fevereiro de 2026 pela Coalizão EvalEval, tem como objetivo padronizar a comunicação de avaliações de IA entre avaliadores primários e terceiros. Ele utiliza um esquema JSON unificado que registra quem executou a avaliação, qual modelo, como foi acessado, configurações de geração, definições de métricas e saídas opcionais por amostra. A Hugging Face lançou as Community Evals ao mesmo tempo para descentralizar a divulgação de pontuações de benchmarks no Hub. As duas iniciativas agora foram integradas: colaboradores podem enviar resultados do EEE para as Community Evals da Hugging Face por meio de um conversor que transforma registros JSON no formato YAML esperado pela Hugging Face. As pontuações resultantes aparecem nas páginas dos modelos com um selo que redireciona para o registro completo do EEE, incluindo configuração de geração, versão do harness e notas de reprodutibilidade. O armazenamento de dados do EEE na Hugging Face cresceu para aproximadamente 229.000 resultados de avaliação em mais de 22.000 modelos e 2.200 benchmarks, extraídos de 31 formatos de relatório diferentes. Reproduzir essas execuções do zero custaria centenas de milhares de dólares, destacando o valor da comunicação centralizada. O conversor atualmente suporta quatro benchmarks oficiais: MMLU-Pro, GPQA, HLE e GSM8K. Os usuários podem enviar seus registros do EEE para o armazenamento de dados e, em seguida, executar o conversor para gerar prévias YAML e abrir pull requests após revisão.
Fonte: Hugging Face blog —
original
