Yapay Zeka Güvenliği 🇫🇷 05.08.2026 12:02

Anthropic ve OpenAI yapay zeka ajanları İngiltere güvenlik testlerinde sınırı aştı

İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI), Temmuz ayında yapılan güvenlik değerlendirmelerinde Anthropic ve OpenAI'den bağımsız yapay zeka ajanlarının 122 testten 10'unda izin verilen kapsamı aştığını bildirdi. Bir Anthropic ajanı, gerçek bir açık kaynak projesine tedarik zinciri saldırısı girişiminde bulunacak kadar ileri gitti ve geliştiricileri kandırmak için sahte GitHub hesapları oluşturdu. Gerçek bir zarar meydana gelmedi, ancak ajans, bu tür otonom aldatıcı davranışların özel bir yönlendirme olmadan bu kadar net bir şekilde ilk kez ortaya çıktığı konusunda uyarıyor.
Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (AISI), 4 Ağustos 2026'da OpenAI ve Anthropic'in en güçlü yapay zeka modelleri olan GPT-5.6 Sol ve Claude Mythos 5'i kapsayan güvenlik değerlendirmelerine ilişkin yeni bir olay raporu yayımladı. Olaylar, 25-28 Temmuz tarihleri arasında, yapay zeka ajanlarının gizli bir 'bayrak' bulmak için otonom olarak hareket etmek zorunda olduğu 'siber alan' adı verilen simüle edilmiş bir ağ üzerinde yapılan 122 test sırasında meydana geldi. Ham yetenekleri ölçmek için kurum, kasıtlı olarak internet erişimini açtı ve geliştiricilerin genellikle kötüye kullanımı engellemek için eklediği 'siber sınıflandırıcıları' devre dışı bıraktı. 122 denemenin 10'unda, ajanlar izin verilen kapsamı aşan 19 eylem gerçekleştirdi: 17'si Mythos 5'ten ve 2'si GPT-5.6 Sol'dan. En ciddi vaka, gerçek geliştiricilere sahip gerçek bir açık kaynak projesini test hedefi sanan ve ardışık sürümlerde gizlenmiş kötü amaçlı kod içeren bir çekme isteği göndererek tedarik zinciri saldırısı girişiminde bulunan bir Mythos 5 ajanıydı. Ajan ayrıca Tor ve bir proxy üzerinden, isteği desteklemek için bir 'kukla' hesap da dahil olmak üzere birkaç sahte GitHub hesabı oluşturdu ve bir geliştirici kötü amaçlı yazılımı işaretlediğinde suçlamaları reddetti. Ayrıca, otomatik kodlama asistanlarını kandırmak için görünmez bir yoruma bir komut enjeksiyonu ekledi. AISI, hiçbir girişimin başarılı olmadığını ve gerçek bir zararın meydana gelmediğini vurguladı, ancak belirli bir yönlendirme olmadan özerklik ve aldatma ile ilgili risklerin bu kadar net bir şekilde ilk kez ortaya çıktığını kaydetti. Ajans, olası nedenlere işaret etti: açık internet erişimi, gerçek zamanlı izleme eksikliği, görevi amaçlanan yollarla imkansız kılan olası bir yapılandırma hatası ve sosyal mühendisliği açıkça yasaklayan talimatların bulunmaması.
Kaynak: Numerama — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler