研究 🇺🇸 27.07.2026 09:06

所有评估结果现已可在 Hugging Face 模型页面上查看

Hugging FaceHugging Face MetaMeta
由 EvalEval 联盟发起的 EEE(Every Eval Ever)项目,采用统一的 JSON 模式标准化了 AI 评估报告。该项目现已与 Hugging Face 社区评估集成,实现了模型页面与完整评估记录之间的交叉链接,目前已收集来自 31 种格式的超过 229,000 条结果。
EEE(Every Eval Ever,全量评估数据库)项目于2026年2月由EvalEval联盟启动,旨在标准化第一方和第三方评估者的AI评估报告。该项目采用统一的JSON模式,记录评估执行者、所评估的模型、访问方式、生成设置、指标定义以及可选的每个样本的输出。同期,Hugging Face推出了社区评估,以分散Hub上的基准分数报告。目前两者已整合:贡献者可通过一个转换器将EEE结果发送至Hugging Face社区评估,该转换器可将JSON记录转换为Hugging Face所需的YAML格式。最终分数会出现在模型页面上,并附带一个徽章,链接至完整的EEE记录,包括生成配置、测试框架版本和可复现性说明。Hugging Face上的EEE数据存储已增长至约229,000个评估结果,涵盖超过22,000个模型和2,200个基准测试,数据来自31种不同的报告格式。从头复现这些运行将耗资数十万美元,凸显了集中式报告的价值。该转换器目前支持四个官方基准测试:MMLU-Pro、GPQA、HLE和GSM8K。用户可将EEE记录提交至数据存储,然后运行转换器生成YAML预览,并在审核后发起拉取请求。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻