AgenKeamanan AI 🇷🇺 12.08.2026 00:02

Cara Saya Memverifikasi Bahwa Armada Agen AI Saya Benar-Benar Otonom

AnthropicAnthropic
Seorang operator armada agen AI menjelaskan bagaimana mereka membangun perangkat verifikasi untuk membuktikan otonomi agen mereka. Mereka mendefinisikan empat invarian sebagai fungsi murni atas log peristiwa dan menjalankannya pada data nyata. Hasilnya menunjukkan bahwa meskipun risiko tingkat dua dijaga dengan baik oleh persetujuan manusia, verifikasi independen hampir tidak pernah dilakukan, mengungkap kesenjangan antara disiplin yang dinyatakan dan kenyataan.
Seorang operator armada agen AI, yang bukan berlatar belakang pengembang, berupaya membuktikan bahwa armada empat mesinnya yang menjalankan negosiasi selama enam minggu benar-benar otonom. Mereka mendefinisikan empat invarian (INV-1 hingga INV-4) sebagai fungsi murni atas log peristiwa untuk memverifikasi aturan perilaku seperti persetujuan manusia sebelum melakukan tindakan tingkat dua dan verifikasi independen sebelum melakukan komitmen. Menjalankan pemeriksaan ini terhadap 64 proposal nyata dan 317 peristiwa, mereka menemukan bahwa INV-1 (gerbang manusia untuk tingkat dua) lulus 100%, tetapi INV-2 (verifikasi independen) hanya 7,7%, menunjukkan bahwa VERIFY bersifat nasihat dan tidak ditegakkan. INV-3 menangkap bug duplikasi peristiwa di mana sebuah hub mengulangi ACCEPT sebanyak 17 kali, dan INV-4 mengungkapkan lima eskalasi yang dilakukan tanpa menunggu resolusi manusia. Operator tersebut memublikasikan hasil ini secara transparan, termasuk jejak nyata yang menunjukkan alur persetujuan manusia yang tepat dan jejak yang sama gagal dalam INV-2 karena verifikasi dilakukan oleh pelaku komitmen. Mereka juga membahas keterbatasan, kesalahan, dan kode sumber terbuka untuk perangkat evaluasi.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru