AgenKeamanan AI 🇷🇺 28.07.2026 10:02

416 Tes dan Tombol 'Hancurkan Semua': di Mana Proyek Agen Gagal

AnthropicAnthropic
Analisis terhadap enam proyek agen mengungkapkan cacat berulang: keamanan sebagai teks, tindakan ireversibel tanpa gerbang, dan nol tes perilaku. Bahkan proyek sumber terbuka matang dengan tes regresi masih kekurangan pengaman untuk pengiriman email ireversibel. Penulis mengusulkan sepuluh pertanyaan diagnostik untuk menilai kematangan sistem agen.
Penulis telah menjalankan agen otonom bernama Groundhog (Surok) sejak Februari 2026 pada putaran penelitian dengan Claude Code dan --dangerously-skip-permissions. Mereka kemudian mengaudit enam proyek agen mereka sendiri terhadap daftar periksa gabungan dari enam sumber (termasuk metodologi PDLC AI-DISRUPT milik Sber) dan menemukan tiga pola kegagalan yang berulang: keamanan hanya ditegakkan dalam prompt (model dapat ditimpa), tindakan yang tidak dapat dibatalkan tanpa konfirmasi (misalnya, perintah rebuild menghapus semua data yang diperkaya), dan tidak ada pengujian regresi untuk bug perilaku. Penulis juga meninjau proyek agen sumber terbuka besar anonim: proyek tersebut memiliki pemeriksaan izin di tingkat kode dan pengujian regresi untuk bug masa lalu, tetapi masih mengirim surel secara tidak dapat dibatalkan tanpa langkah draf/konfirmasi. Kerangka kerja sumber terbuka yang lebih baru (HarnessX) menawarkan gate interrupt_on tetapi opsional dan bukan bawaan. Metodologi PDLC Sber meresmikan banyak kontrol yang hilang: kebijakan sebagai kode, eval sebagai kontrak penyelesaian, dan tangga izin R0–R5 dengan batalkan/kembalikan wajib untuk operasi perubahan status di R3+. Penulis membangun proyek ketujuh yang menerapkan beberapa pelajaran yang dipetik: sekarang eval dijalankan sebelum setiap rilis dan insiden menjadi pengujian regresi bernama.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru