AjanlarYapay Zeka Güvenliği 🇷🇺 12.08.2026 00:02

AI Ajan Filosunun Gerçekten Otonom Olduğunu Nasıl Doğruladım

AnthropicAnthropic
Bir AI ajan filosunun operatörü, ajanlarının otonomluğunu kanıtlamak için nasıl bir doğrulama düzeneği kurduklarını anlatıyor. Dört değişmezi, olay günlükleri üzerinde saf fonksiyonlar olarak tanımlayıp gerçek veriler üzerinde çalıştırdılar. Sonuçlar, ikinci seviye risklerin insan onayıyla uygun şekilde kapatıldığını ancak bağımsız doğrulamanın neredeyse hiç yapılmadığını, beyan edilen disiplin ile gerçeklik arasında bir boşluk olduğunu ortaya koydu.
Teknik geçmişi olmayan bir yapay zeka ajan filosu operatörü, altı hafta boyunca müzakereler yürüten dört makinelik filolarının gerçekten otonom olduğunu kanıtlamaya koyuldu. INV-1'den INV-4'e kadar dört değişmezi (invariant), insan onayı olmadan ikinci kademe eylemlerde bulunmama ve işlem yapılmadan önce bağımsız doğrulama gibi davranışsal kuralları doğrulamak için olay günlükleri üzerinde saf işlevler olarak tanımladılar. Bu kontrolleri 64 gerçek teklif ve 317 olay üzerinde çalıştırdıklarında, INV-1'in (ikinci kademe için insan kapısı) %100 geçtiğini, ancak INV-2'nin (bağımsız doğrulama) yalnızca %7,7 olduğunu buldular; bu da DOĞRULA (VERIFY) eyleminin tavsiye niteliğinde olduğunu ve zorunlu olmadığını gösteriyordu. INV-3, bir hub'ın KABUL (ACCEPT) eylemini 17 kez tekrarladığı yinelenen bir olay fırtınası hatasını yakaladı ve INV-4, insan çözümü beklenmeden işlenen beş yükseltmeyi ortaya çıkardı. Operatör bu sonuçları şeffaf bir şekilde yayınladı; hem uygun bir insan onay akışını hem de doğrulamanın işleyen tarafından yapılması nedeniyle aynı izlemenin INV-2'de başarısız olduğunu gösteren gerçek bir iz dahil. Ayrıca sınırlamaları, hataları ve değerlendirme donanımı için açık kaynak kodunu tartıştılar.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler