AraştırmaAjanlar 🇨🇳 10.08.2026 18:02

Yapay Zeka, En İyi Makalelerin Yüzde 99,2'sindeki Kusurları Ortaya Çıkarıyor!

OpenAIOpenAI
Yapay zeka ajanları kullanılarak yapılan son denetimler, birçok üst düzey yapay zeka konferans makalesinin tekrarlanabilir olmadığını ve nesnel hatalar içerdiğini ortaya koydu. Bir araştırma, makalelerin yüzde 99,2'sinin en az bir hata içerdiğini ve makale başına ortalama 4,7 hata düştüğünü buldu. Bu eğilim, akademik denetimde yeni araştırma fırsatlarına işaret ediyor.
Araştırmacılar, yapay zekâ ajanlarını en üst düzey yapay zekâ konferanslarındaki makaleleri denetlemek için kullandılar; yayınlanan sonuçların birçoğunun yeniden üretilemediğini buldular. Örneğin, ICML 2026'daki tüm 168 sözlü sunumun yapay zekâ ajanı denetimi, en az beş doğrulanabilir iddiaya sahip 92 makaleden yalnızca 34'ünün sonuçların %40'ından fazlasını yeniden üretebildiğini ve yalnızca 8'inin %80'den fazlasını yeniden üretebildiğini ortaya koydu. Ayrıca, dört makale çevrimdışı duruma getirilmiş bir modele dayanıyordu ve bu da sonuçlarını kalıcı olarak yeniden üretilemez hale getiriyordu. Başka bir çalışma, en üst düzey yapay zekâ konferanslarından makaleleri inceleyen GPT-5 tabanlı bir makale denetleyicisi geliştirdi; ortalama olarak her makalenin 4,7 nesnel hata içerdiğini ve makalelerin %99,2'sinin en az bir soruna sahip olduğunu buldu. Matematiksel ve formül hataları en yaygın olanlardı (%54,0). NeurIPS makalesi başına düşen hata sayısı 2021'de 3,8'den 2025'te 5,9'a yükseldi. Bu bulgular, bilimsel yeniden üretilebilirlikte büyüyen bir sorunu vurguluyor ve eski makaleleri gözden geçirme ve hataları düzeltme gibi yeni araştırma yönleri için fırsatlar öneriyor. Ayrıca, Zhejiang Laboratuvarı'nda teorik bir kimyager, yapay zekânın 75 yıllık bir veritabanından farklı kaynama noktaları tahmin ettiğini keşfetti ve manuel doğrulama sonrasında yapay zekânın doğru olduğu görüldü; bu da asırlık ölçümlerdeki hataları ortaya çıkardı. Bu, yapay zekânın artık tarihsel bilimsel literatürün yeniden değerlendirilmesine yardımcı olabileceğini gösteriyor.
Kaynak: QbitAI 量子位 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler