OpenAI Saha Raporu: Yapay zeka ajanları kırılgan araştırma yazılımlarını yeniden yazıyor, ancak araştırmacılar titizlikle doğrulamalı
OpenAI
Anthropic
OpenAI ve akademik ortakları, yapay zeka kodlama ajanlarının eski araştırma yazılımlarını hızlandırabildiğini ve bakımını yapabildiğini, ancak yükün programlamadan doğrulamaya kaydığını buldu. Sekiz vaka çalışmasında ajanlar araçları modernize etti, bazıları 60 kattan daha hızlı çalıştı, ancak yanlış kod üretirken sıklıkla kendinden emin davrandılar. Araştırmacılar bağımsız doğrulama ve bilimsel gözetim ihtiyacını vurguluyor.
OpenAI ve akademik ortaklar tarafından hazırlanan bir saha raporu, çoğunlukla biyoloji alanında, Codex ve Claude Code gibi kodlama ajanlarının araştırma yazılımlarını bakımını yapmak, optimize etmek veya yeniden yazmak için kullanıldığı sekiz vaka çalışmasını belgeliyor. Projeler basit bakımdan modern dillerde tamamen yeniden yazıma kadar uzanıyor. Örneğin, GPT-5.5, Python kütüphanesi cyvcf2'nin derleme sürecini modernize ederken, iki ajan (Claude Code ve Codex) MHCflurry'nin yaklaşık 10.000 satırını TensorFlow'dan PyTorch'a taşıdı. rustar-aligner projesi, binlerce satırlık C/C++ aracı STAR'ı Rust dilinde yeniden yazarak test veri setlerinde orijinaliyle %99,815 ve %99,883 uyum sağladı. 15 kalite kontrol aracını bir araya getiren RustQC, çalışma süresini 15 saat 34 dakikadan 14 dakika 54 saniyeye düşürdü; bu 60 kattan fazla bir hızlanma demek. BamSurgeon'ın yerine geçen HelixForge ise genel olarak 59,6 kat, çekirdek hesaplamada ise 98,6 kat daha hızlıydı. Ancak ajanlar genellikle kendinden emin görünüyor ancak yanılıyordu; örneğin, bayesm yeniden yazımında iki prosedür, ters çevrilmiş bir kontrol parametresi ve hatalı bir ölçekleme faktörü dahil olmak üzere ince hatalar içeriyordu. Araştırmacılar, insanların hedefleri, başarı kriterlerini ve doğrulama yöntemlerini tanımlaması gerektiği, ajanların ise uygulamayı üstlenmesi gerektiği sonucuna vardı. Rapor, önemli zaman tasarrufları tahmin ediyor; örneğin, NumPy'in bakımı yılda yaklaşık 650 saat kazandırabilir, ancak uzun vadeli bakım ve sorumluluğu temel zorluklar olarak vurguluyor. Bazı değişiklikler ana depoya entegre edilirken, FastQC gibi diğerleri orijinal yazar tarafından reddedildi ve iyileştirmeler bunun yerine orijinal Java sürümüne dahil edildi. Rapor geriye dönük ve öz bildirimlere dayanıyor ve darboğazın uygulamadan doğrulama ve bilimsel incelemeye kaydığını belirtiyor. Bu model, bir METR çalışması ve geliştirici ekiplerin yapay zeka koduna yönelik hayal kırıklığı üzerine bir çalışma ile de yankılanıyor. Rapor, OpenAI'nin Kevin Weil liderliğindeki özel bir ekibi ve GPT-Rosalind'in yayınlanmasını içeren daha geniş bilim stratejisiyle uyumlu.
Kaynak: The Decoder (DE) —
orijinal
