Mitä opimme toistamalla 2 200 ICML-paperia
Hugging Face
Anthropic
OpenAI
Cursor
alphaXiv
Hugging Face järjesti yhteistyössä alphaXivin kanssa ICML 2026 Open Reproductions -haasteen, jossa osallistujat käyttivät tekoälypohjaisia koodausagentteja yrittääkseen toistaa 2 200 paperia. Tulokset: 51 prosentissa tutkituista papereista vähintään yksi väite varmennettiin, 23 prosentissa väite osoittautui vääräksi tai kiistanalaiseksi, ja 242 paperissa arviot olivat ristiriitaisia. Ihmisen valvonta osoittautui ratkaisevan tärkeäksi, sillä agentit kohtasivat rajoja ja väärät väärennökset olivat mahdollisia. Tapahtumaa pidetään tähän mennessä laajimpana konepohjaisena väitetason auditoinnin konferenssissa.
Hugging Face ja alphaXiv järjestivät ICML 2026 Open Reproductions -haasteen 15. heinäkuuta – 2. elokuuta 2026, jossa osallistujia pyydettiin toistamaan konferenssin papereita tekoälyohjelmointiagenttien, kuten Claude Coden, Codexin, Cursorin ja Pi:n, avulla. Osallistujat saivat 20 dollarin arvosta laskentaluottoja ja käynnistivät 2 962 pilvitehtävää; kun täydellinen toisto ei ollut mahdollista, käytettiin lelureproduktioita synteettisellä datalla. Tutkituista 2 200 paperista 1 103:ssa (51 prosentissa) vähintään yksi väite varmennettiin itsenäisesti, mukaan lukien 266 täysin toistettua ja 632 osittain toistettua ilman vastaansanomisia; 3 978 yksittäistä väitettä vahvistettiin. Kuitenkin 496:ssa (23 prosentissa) vähintään yksi väite osoitettiin vääräksi tai kiistanalaiseksi, mukaan lukien 49, joissa kaikki väitteet olivat vääriä, ja 242, joissa itsenäiset tiimit päätyivät vastakkaisiin arvioihin samoista väitteistä. Merkittäviä vahvistettuja vääristymiä ovat muun muassa sivutusteknologiapaperin todistuksen epäonnistuminen, kun k = 1024, lauseen romahtaminen vaiheessa 224, teoriapaperi, joka käytti käänteistä KL-divergenssiä, kun koodi käytti suoraa KL-divergenssiä, ja arvioinnin laimeneminen EOS-täytepohjustuksen vuoksi. Järjestäjät tarkistivat kaikki väitetyt vääristymät ja ottivat yhteyttä kirjoittajiin, jotka suhtautuivat myönteisesti. Haaste nosti esiin myös sen, että agentit kohtasivat rajoja, kuten paikallisia silmukoita ja virhetulkintoja, ja että ihmisen valvonta oli välttämätöntä luotettavien tulosten saavuttamiseksi, kuten nähtiin ihmisen ohjaamassa voittajassa, joka arvioi kuvapareja henkilökohtaisesti. Tapahtumaa pidetään suurimpana avoimena, väitekohtaisena koneoppimiskonferenssin tarkastuksena, ja kaikki lokikirjat, tuomiot, jäljet ja artefaktit ovat julkisia.
Lähde: Hugging Face blog —
Alkuperäinen
