Recherche 🇺🇸 13.08.2026 20:03

Ce que nous avons appris en reproduisant 2 200 articles ICML

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging Face, en partenariat avec alphaXiv, a organisé le défi Open Reproductions ICML 2026, où les participants ont utilisé des agents de codage IA pour tenter de reproduire 2 200 articles. Les résultats : 51 % des articles examinés ont vu au moins une affirmation vérifiée, 23 % ont eu une affirmation falsifiée ou contestée, et 242 articles ont donné lieu à des verdicts contradictoires. La supervision humaine s'est avérée cruciale, car les agents ont atteint leurs limites et des fausses falsifications se sont produites ; l'événement est considéré comme la plus grande vérification au niveau des affirmations d'une conférence sur l'apprentissage automatique à ce jour.
Hugging Face et alphaXiv ont organisé le défi de reproductions ouvertes de l'ICML 2026 du 15 juillet au 2 août 2026, invitant les participants à reproduire des articles de la conférence en utilisant des agents de codage IA comme Claude Code, Codex, Cursor et Pi. Les participants ont reçu 20 $ de crédits de calcul et ont lancé 2 962 jobs cloud ; lorsque la reproduction complète était impossible, des reproductions jouets sur données synthétiques ont été utilisées. Sur les 2 200 articles examinés, 1 103 (51 %) avaient au moins une affirmation vérifiée indépendamment, dont 266 entièrement reproduits et 632 partiellement reproduits sans aucune falsification ; 3 978 affirmations individuelles ont été confirmées. Cependant, 496 (23 %) avaient au moins une affirmation falsifiée ou contestée, dont 49 avec toutes les affirmations falsifiées et 242 où des équipes indépendantes ont abouti à des verdicts opposés sur les mêmes affirmations. Des falsifications notables confirmées incluent la preuve d'un article sur la pagination échouant après k=1024, un théorème s'effondrant à l'étape 224, un article théorique utilisant la divergence KL inverse alors que le code utilisait la divergence KL directe, et une évaluation diluée par des jetons de padding EOS. Les organisateurs ont re-vérifié toutes les falsifications revendiquées et ont contacté les auteurs, qui ont répondu positivement. Le défi a également souligné que les agents atteignent leurs limites, comme des boucles locales et des interprétations erronées, et que la supervision humaine était essentielle pour obtenir des résultats fiables, comme en témoigne le gagnant avec supervision humaine qui a personnellement jugé des paires d'images. L'événement est considéré comme le plus grand audit ouvert, affirmation par affirmation, d'une conférence sur l'apprentissage automatique, et tous les journaux de bord, verdicts, traces et artefacts sont publics.
Source: Hugging Face blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches