AjanlarYapay Zeka Güvenliği 🇷🇺 28.07.2026 10:02

416 test ve bir 'tümünü yok et' butonu: ajan projelerinin kırılma noktaları

AnthropicAnthropic
Altı ajan projesinin analizi, tekrarlayan kusurları ortaya koyuyor: güvenlik olarak metin, kapısız geri döndürülemez eylemler ve sıfır davranış testi. Regresyon testlerine sahip olgun bir açık kaynak projesi bile geri döndürülemez e-posta gönderme için hâlâ güvenlik önlemlerinden yoksun. Yazar, ajan sistemi olgunluğunu değerlendirmek için on teşhis sorusu önermektedir.
Yazar, Şubat 2026'dan beri Claude Code ve --dangerously-skip-permissions ile bir araştırma döngüsünde Groundhog (Surok) adlı otonom bir ajanı çalıştırıyor. Daha sonra altı ajan projesini, altı kaynaktan (Sber'in AI-DISRUPT PDLC metodolojisi dahil) oluşan birleşik bir kontrol listesine karşı denetledi ve üç yinelenen başarısızlık deseni buldu: güvenlik yalnızca istemlerde uygulanmış (model geçersiz kılınabilir), onay alınmadan geri döndürülemez eylemler (örneğin, bir yeniden derleme komutu tüm zenginleştirilmiş verileri siler) ve davranışsal hatalar için sıfır regresyon testi. Yazar ayrıca anonim büyük bir açık kaynak ajan projesini inceledi: kod düzeyinde izin kontrolleri ve geçmiş hatalar için regresyon testleri vardı, ancak yine de bir taslak/onay adımı olmadan geri döndürülemez şekilde e-postalar gönderiyordu. Daha yeni bir açık kaynak çerçevesi (HarnessX), opsiyonel bir interrupt_on kapısı sunuyor ancak varsayılan değil. Sber'in PDLC metodolojisi, eksik kontrollerin çoğunu resmileştiriyor: politika olarak kod, değerlendirmeler olarak tamamlama sözleşmeleri ve R3+ seviyesinde durum değiştiren işlemler için zorunlu iptal/geri alma ile birlikte R0-R5 izin merdiveni. Yazar, çıkarılan derslerin bir kısmını uygulayan yedinci bir proje inşa etti: artık her yayından önce değerlendirmeler çalışıyor ve olaylar adlandırılmış regresyon testleri haline geliyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler