Science One Framework: Zincir-Kanıt Yöntemi ile Doğrulanabilir Otonom Araştırma Çerçevesi
Google/DeepMind
Sakana AI
Google Research, halüsinasyonları ortadan kaldırmak için doğrulanabilir kanıt zincirleri oluşturan Science One Framework adlı otonom araştırma prototipini ve yapay zeka tarafından üretilen makalelerin bütünlüğünü değerlendirmek için otomatik bir protokol olan CoE Audit'i tanıtıyor. Sonuçlar, Science One'ın sıfır hayali referans ve tamamen doğrulanabilir puanlar elde ettiğini ve kıyaslamalarda insan uzman performansını yakaladığını veya aştığını gösteriyor.
Google Research, Science One Framework adlı otonom bir araştırma prototipini tanıttı. Bu prototip, doğrulanabilir kanıt zincirlerini yerel olarak oluşturarak halüsinasyonları ortadan kaldırmak ve CoE Audit adlı, yapay zeka tarafından üretilen makalelerin bütünlüğünü değerlendirmek için otomatik bir protokolü içeriyor. Çerçeve, Chain-of-Evidence (Kanıt Zinciri, CoE) adlı yeni bir doğrulanabilirlik konseptine dayanıyor. Bu konsept, bir araştırma ürünündeki her iddianın kaydedilmiş bir kanıt zincirine sahip olmasını (tamlık) ve her zincirin iddiayı gerçekten desteklemesini (doğruluk) gerektiriyor. Science One Framework, CoE'yi üç ana modül aracılığıyla somutlaştırıyor: bir Fikir Kaşifi, bir Problem Araştırmacısı ve bir Çözüm Geliştiricisi. CoE Audit ise dört katı bütünlük kontrolü uyguluyor: referans doğrulama, puan doğrulama, kod tekrarlanabilirliği ve yöntem-kod uyumu. ADRS benchmark'ındaki 75 makale üzerinde yapılan değerlendirmelerde, Science One, %21'e varan temel halüsinasyon oranlarına kıyasla sıfır hayali referans, mükemmel puan doğrulama ve en yüksek yöntem-kod uyumu elde ederken, ADRS'deki beş görevin tümünde insan uzman performansını yakaladı veya geçti. Çerçeve ayrıca MLE-Bench ve Parameter-Golf dahil olmak üzere altı harici karmaşık görevde test edildi ve en son teknoloji sonuçlar elde etti.
Kaynak: Google Research —
orijinal
