开源 🇺🇸 27.07.2026 09:06

所有AI评估结果现已整合至Hugging Face模型页面

Hugging FaceHugging Face MetaMeta
EEE(“所有评估结果”)项目与Hugging Face的Community Evals平台联手,实现了AI评估报告的标准化。开发者现在可以提交统一JSON格式的结果,模型页面将展示经过验证的数据,并链接到完整的评估协议。
2026年2月,EvalEval联盟旗下的EEE(Every Eval Ever)项目正式启动。EvalEval是首个旨在改进人工智能评估报告质量的跨组织倡议。与此同时,Hugging Face推出了Community Evals,用于在平台上实现基准测试的去中心化展示。此前,评估结果分散在论文、排行榜、博客和日志中,格式各异,且同一模型在相同基准测试上可能因未记录的设置而给出不同分数(例如,LLaMA 65B在MMLU上的得分分别为63.7和48.8)。EEE引入了一个统一的JSON模式来记录评估结果,包括评估执行者、模型、访问方式、生成设置和指标描述等数据。Hugging Face上的EEE仓库已包含约22.9万条结果,涵盖超过2.2万个模型和2200个基准测试,这些结果从31种报告格式中提取而来。现在,转换器会自动将EEE记录转换为Hugging Face Community Evals所需的YAML文件,并提交它们。如果数据通过组织的官方账户提交,模型页面上的结果将获得EvalEval的已验证勾选标记。转换器会匹配字段、检查现有结果,并在用户确认后创建拉取请求(PR)。支持MMLU-Pro、GPQA、HLE和GSM8K基准测试。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻