2.200 ICML Makalesini Yeniden Üreterek Öğrendiklerimiz
Hugging Face
Anthropic
OpenAI
Cursor
alphaXiv
Hugging Face, alphaXiv ile ortaklaşa ICML 2026 Açık Yeniden Üretim yarışmasını düzenledi; katılımcılar, yapay zekâ kodlama ajanlarını kullanarak 2.200 makaleyi yeniden üretmeye çalıştı. Sonuçlar: incelenen makalelerin %51'inde en az bir iddia doğrulandı, %23'ünde bir iddia yanlışlandı veya tartışmalı bulundu ve 242 makalede çelişkili kararlar verildi. İnsan denetimi kritik önem taşıdı; ajanlar sınırlara ulaştı ve yanlış yanlışlamalar meydana geldi. Etkinlik, şimdiye kadar bir makine öğrenimi konferansının iddia düzeyinde yapılan en büyük denetimi olarak kabul ediliyor.
Hugging Face ve alphaXiv, 15 Temmuz - 2 Ağustos 2026 tarihleri arasında ICML 2026 Açık Yeniden Üretim yarışmasını düzenledi. Katılımcılar, Claude Code, Codex, Cursor ve Pi gibi yapay zeka kodlama ajanlarını kullanarak konferanstaki makaleleri yeniden üretmeye davet edildi. Katılımcılara 20 dolarlık bilgi işlem kredisi verildi ve 2.962 bulut işi başlatıldı; tam yeniden üretimin mümkün olmadığı durumlarda, sentetik veriler üzerinde oyuncak yeniden üretimler kullanıldı. İncelenen 2.200 makalenin 1.103'ünde (%51) en az bir iddia bağımsız olarak doğrulandı; bunların 266'sı tamamen yeniden üretildi ve 632'si hiçbir yanlışlama olmaksızın kısmen yeniden üretildi; 3.978 bireysel iddia doğrulandı. Ancak, 496 makalede (%23) en az bir iddia yanlışlandı veya itiraz edildi; bunların 49'unda tüm iddialar yanlışlandı ve 242'sinde bağımsız ekipler aynı iddialar hakkında zıt kararlara vardı. Doğrulanmış önemli yanlışlamalar arasında, bir sayfalama makalesinin kanıtının k=1024'ten sonra başarısız olması, bir teoremin 224. adımda çökmesi, bir teori makalesinin kodda ileri KL kullanırken ters KL kullanması ve bir değerlendirmenin EOS dolgu token'ları ile seyreltilmesi yer alıyor. Organizatörler, iddia edilen tüm yanlışlamaları yeniden doğruladı ve yazarlarla iletişime geçti; yazarlar olumlu yanıt verdi. Yarışma ayrıca, ajanların yerel döngüler ve yanlış yorumlamalar gibi sınırlamalarla karşılaştığını ve güvenilir sonuçlar için insan gözetiminin gerekli olduğunu vurguladı; bu durum, görüntü çiftlerini bizzat değerlendiren insan-ın-the-loop kazananında görüldü. Etkinlik, bir makine öğrenimi konferansının iddia bazında yapılan en büyük açık denetimi olarak kabul ediliyor ve tüm kayıt defterleri, kararlar, izler ve eserler halka açık.
Kaynak: Hugging Face blog —
orijinal
