Onderzoek 🇺🇸 13.08.2026 20:03

Wat we leerden door 2.200 ICML-papers te reproduceren

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging Face, in samenwerking met alphaXiv, organiseerde de ICML 2026 Open Reproductions-uitdaging, waarbij deelnemers AI-codeeragenten gebruikten om 2.200 papers te reproduceren. De resultaten: 51% van de onderzochte papers had minstens één bewering geverifieerd, 23% had een bewering weerlegd of betwist, en 242 papers hadden tegenstrijdige oordelen. Menselijk toezicht bleek cruciaal, omdat agenten beperkingen ondervonden en er onterechte weerleggingen plaatsvonden; het evenement wordt beschouwd als de grootste beoordeling op beweringniveau van een ML-conferentie tot nu toe.
Hugging Face en alphaXiv organiseerden van 15 juli tot 2 augustus 2026 de ICML 2026 Open Reproductions challenge, waarbij deelnemers werden uitgenodigd om papers van de conferentie te reproduceren met behulp van AI-codeeragenten zoals Claude Code, Codex, Cursor en Pi. Deelnemers ontvingen $20 aan rekenkrediet en lanceerden 2.962 cloudtaken; waar volledige reproductie onmogelijk was, werden toy-reproducties op synthetische data gebruikt. Van de 2.200 onderzochte papers hadden er 1.103 (51%) ten minste één bewering die onafhankelijk werd geverifieerd, waaronder 266 volledig gereproduceerd en 632 gedeeltelijk gereproduceerd zonder falsificaties; 3.978 individuele beweringen werden bevestigd. Echter, 496 (23%) hadden ten minste één bewering die werd gefalsificeerd of betwist, waaronder 49 met alle beweringen gefalsificeerd en 242 waarbij onafhankelijke teams tot tegengestelde conclusies kwamen over dezelfde beweringen. Opmerkelijke bevestigde falsificaties zijn onder meer een paging-paper waarvan het bewijs faalde na k=1024, een stelling die instortte bij stap 224, een theoriepaper dat reverse KL gebruikte terwijl de code forward KL gebruikte, en een evaluatie die verwaterd werd door EOS-paddingtokens. De organisatoren hebben alle geclaimde falsificaties opnieuw geverifieerd en contact opgenomen met de auteurs, die positief reageerden. De challenge benadrukte ook dat agenten beperkingen ondervonden, zoals lokale loops en misinterpretaties, en dat menselijk toezicht essentieel was voor betrouwbare resultaten, zoals te zien was bij de human-in-the-loop-winnaar die persoonlijk beeldparen beoordeelde. Het evenement wordt beschouwd als de grootste open, claim-voor-claim audit van een machine learning-conferentie, en alle logboeken, uitspraken, traces en artefacten zijn openbaar.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws