研究 🇺🇸 13.08.2026 20:03

ICML論文2,200本を再現して分かったこと

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging FaceはalphaXivと協力し、ICML 2026オープン再現チャレンジを開催しました。参加者はAIコーディングエージェントを使用して2,200本の論文の再現を試みました。結果、調査された論文の51%で少なくとも1つの主張が検証され、23%で主張が反証または異議が唱えられ、242本の論文では結論が矛盾しました。エージェントが限界に達し、誤った反証が発生するため、人間による監視が重要であることが判明しました。このイベントは、これまでで最大のML会議の主張レベルの監査と見なされています。
Hugging FaceとalphaXivは、2026年7月15日から8月2日まで、ICML 2026オープンリプロダクションズチャレンジを開催し、参加者がClaude Code、Codex、Cursor、PiなどのAIコーディングエージェントを使って会議の論文を再現することを募集しました。参加者は20ドルの計算クレジットを受け取り、2,962件のクラウドジョブを立ち上げました。完全な再現が不可能な場合は、合成データによるおもちゃの再現が使用されました。調査された2,200件の論文のうち、1,103件(51%)で少なくとも1つの主張が独立に検証され、完全に再現された266件と、改ざんのない部分的な再現632件が含まれていました。3,978件の個別の主張が確認されました。しかし、496件(23%)では少なくとも1つの主張が反証または異議を唱えられ、49件ではすべての主張が反証され、242件では独立したチームが同じ主張について反対の結論に達しました。確認された反証の注目すべき例には、ページング論文の証明がk=1024で失敗したこと、定理がステップ224で崩壊したこと、理論論文がコードでフォワードKLを使用しているのに逆KLを使用していたこと、評価がEOSパディングトークンによって希釈されたことなどがあります。主催者は主張されたすべての反証を再検証し、著者に連絡を取ったところ、著者は好意的に応じました。このチャレンジはまた、エージェントがローカルループや誤解などの限界に直面し、人間の監督が信頼できる結果を得るために不可欠であることを浮き彫りにしました。これは、人間が介在する勝者が画像ペアを個人的に判断したことからも明らかです。このイベントは、機械学習会議の大規模なオープンな主張ごとの監査として最大規模とされ、すべてのログブック、判定、トレース、成果物は公開されています。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース