Yang Kami Pelajari dengan Mereproduksi 2.200 Makalah ICML
Hugging Face
Anthropic
OpenAI
Cursor
alphaXiv
Hugging Face, bersama alphaXiv, menjalankan tantangan Open Reproductions ICML 2026, di mana peserta menggunakan agen pengkode AI untuk mencoba mereproduksi 2.200 makalah. Hasilnya: 51% makalah yang diperiksa memiliki setidaknya satu klaim yang terverifikasi, 23% memiliki klaim yang dipalsukan atau diperdebatkan, dan 242 makalah memiliki putusan yang bertentangan. Pengawasan manusia terbukti penting, karena agen mencapai batas dan terjadi pemalsuan yang salah; acara ini dianggap sebagai audit tingkat klaim terbesar untuk konferensi pembelajaran mesin hingga saat ini.
Hugging Face dan alphaXiv menyelenggarakan tantangan Open Reproductions ICML 2026 dari 15 Juli hingga 2 Agustus 2026, mengundang peserta untuk mereproduksi makalah dari konferensi tersebut menggunakan agen pengkode AI seperti Claude Code, Codex, Cursor, dan Pi. Peserta menerima kredit komputasi senilai $20 dan meluncurkan 2.962 pekerjaan cloud; ketika reproduksi penuh tidak mungkin dilakukan, reproduksi mainan pada data sintetis digunakan. Dari 2.200 makalah yang diperiksa, 1.103 (51%) memiliki setidaknya satu klaim yang diverifikasi secara independen, termasuk 266 yang direproduksi sepenuhnya dan 632 yang direproduksi sebagian tanpa pemalsuan; 3.978 klaim individu dikonfirmasi. Namun, 496 (23%) memiliki setidaknya satu klaim yang dipalsukan atau disengketakan, termasuk 49 dengan semua klaim dipalsukan dan 242 di mana tim independen mencapai vonis yang berlawanan pada klaim yang sama. Pemalsuan yang dikonfirmasi dan menonjol termasuk bukti makalah paging yang gagal setelah k=1024, teorema yang runtuh pada langkah 224, makalah teori yang menggunakan KL terbalik sementara kode menggunakan KL maju, dan evaluasi yang diencerkan oleh token padding EOS. Penyelenggara memverifikasi ulang semua pemalsuan yang diklaim dan menghubungi penulis, yang merespons secara positif. Tantangan ini juga menyoroti bahwa agen mencapai batas, seperti loop lokal dan salah tafsir, dan pengawasan manusia sangat penting untuk hasil yang andal, seperti yang terlihat pada pemenang human-in-the-loop yang secara pribadi menilai pasangan gambar. Acara ini dianggap sebagai audit terbuka terbesar klaim demi klaim dari konferensi pembelajaran mesin, dan semua buku catatan, vonis, jejak, dan artefak bersifat publik.
Sumber: Hugging Face blog —
asli
