研究AI安全 🇷🇺 27.07.2026 13:06

创建基准测试的六条经验:来自NeurIPS教程

Google DeepMindGoogle DeepMind
SWE-bench和GPQA的作者在NeurIPS上讨论了创建基准测试的主要错误:指标的暴政、众包的主观性、使用大语言模型作为评估器的风险以及动态测试的必要性。主要建议——避免饱和基准测试、检查多模态性,并发布带有置信区间的结果。
在NeurIPS的“基准测试的艺术”教程中,SWE-bench、GPQA的作者以及来自Google DeepMind、纽约大学和伯克利的研究人员讨论了基准测试创建中的关键问题和陷阱。其中包括度量暴政:指标存在甜蜜点,使模型能够“破解”测试,而皮尔逊相关性无法检测到这些点。同时还指出,将大型语言模型(LLM)用作评估来源是危险的:它们仅在校准集上与人类相关,而自我偏见会导致自身结果膨胀。唯一正确的做法是生成模型会失败的示例。基准测试创建者常犯的六大错误包括:在顶级模型上达到70-80%准确率时发布基准测试(应瞄准0-1%)、缺乏对任务真正多模态性的验证、依赖自身的智能理论、未能过滤众包垃圾信息(多达25%的随机答案)、工作集中在单个众包工人身上、以及在没有p值和置信区间的情况下发布结果。未来,我们需要动态基准测试、LLM对人类影响的纵向研究、模型知识的校准,以及猫能解决但GPT无法解决的任务。
来源: Хабр — Data Mining — 原文
我们之前关于此话题的帖子 ↓
最新新闻