研究 🇺🇸 13.08.2026 20:03

我们通过复现2,200篇ICML论文学到的经验

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging Face与alphaXiv合作,开展了ICML 2026开放复现挑战赛,参赛者使用AI编码代理尝试复现2,200篇论文。结果显示:在所审查的论文中,有51%至少有一项主张得到验证,23%存在主张被证伪或质疑,另有242篇论文的结论相互矛盾。人工监督至关重要,因为代理有时达到能力极限,且出现过错误的证伪案例。该活动被认为是迄今对机器学习会议进行的最全面主张级审计。
Hugging Face 与 alphaXiv 于 2026 年 7 月 15 日至 8 月 2 日组织了 ICML 2026 开放复现挑战赛,邀请参赛者使用 Claude Code、Codex、Cursor 和 Pi 等人工智能编码智能体来复现会议论文。参赛者获得 20 美元计算积分,并启动了 2962 个云任务;在无法完全复现的情况下,使用合成数据进行了简化复现。在考察的 2200 篇论文中,有 1103 篇(51%)至少有一项声明得到独立验证,其中 266 篇完全复现,632 篇部分复现,且没有出现证伪情况;共有 3978 项个人声明得到确认。然而,有 496 篇(23%)至少有一项声明被证伪或受到质疑,其中 49 篇的所有声明均被证伪,242 篇中独立团队对相同声明得出了相反的结论。值得注意的已确认证伪包括:一篇关于分页的论文在 k=1024 之后证明失效,一个定理在第 224 步崩溃,一篇理论论文使用反向 KL 散度而代码使用前向 KL 散度,以及一篇评估因 EOS 填充标记而失真。组织者重新验证了所有声称的证伪结果,并联系了作者,作者反应积极。挑战赛还凸显了智能体的局限性,例如局部循环和误解,以及人工监督对于可靠结果至关重要,正如人机协同的获胜者亲自判断图像对所示。该活动被认为是针对机器学习会议的最大规模、开放、逐项声明的审查,所有日志、判定、痕迹和工件均已公开。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻