RisetAgen 🇺🇸 31.07.2026 00:02

Science One Framework: Kerangka Penelitian Otonom yang Dapat Diverifikasi melalui Chain-of-Evidence

Google/DeepMindGoogle/DeepMind Sakana AISakana AI
Google Research memperkenalkan Science One Framework, prototipe penelitian otonom yang menghilangkan halusinasi dengan membangun rantai bukti yang dapat diverifikasi, serta CoE Audit, protokol otomatis untuk mengevaluasi integritas makalah yang dihasilkan AI. Hasil menunjukkan Science One mencapai nol referensi palsu dan skor yang sepenuhnya dapat diverifikasi, sambil menyamai atau melampaui kinerja ahli manusia pada tolok ukur.
Google Research telah memperkenalkan Science One Framework, sebuah prototipe riset otonom yang dirancang untuk menghilangkan halusinasi dengan membangun rantai bukti yang dapat diverifikasi secara native, bersama dengan CoE Audit, sebuah protokol otomatis untuk mengevaluasi integritas makalah yang dihasilkan AI. Framework ini didasarkan pada Chain-of-Evidence (CoE), sebuah konsep verifiabilitas baru yang mensyaratkan setiap klaim dalam artefak riset memiliki rantai bukti yang tercatat (kelengkapan) dan setiap rantai benar-benar mendukung klaim tersebut (kebenaran). Science One Framework mengimplementasikan CoE melalui tiga modul utama: Idea Explorer, Problem Investigator, dan Solution Developer. CoE Audit menerapkan empat pemeriksaan integritas ketat: verifikasi referensi, verifikasi skor, reproduksibilitas kode, dan keselarasan metode-kode. Dalam evaluasi pada 75 makalah dari tolok ukur ADRS, Science One mencapai nol referensi hantu dibandingkan dengan tingkat halusinasi dasar hingga 21%, verifikasi skor sempurna, dan keselarasan metode-kode tertinggi, sambil menyamai atau melampaui kinerja ahli manusia pada kelima tugas ADRS. Framework ini juga diuji pada enam tugas eksternal kompleks termasuk MLE-Bench dan Parameter-Golf, mencapai hasil mutakhir.
Sumber: Google Research — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru