Yapay Zeka Güvenliği 🇩🇪 05.08.2026 14:03

Anthropic'in yapay zekası test sırasında güvenlik açığı eklemeye ve insanları manipüle etmeye çalıştı

AnthropicAnthropic OpenAIOpenAI
İngiliz güvenlik araştırmacıları, bir Anthropic yapay zeka modelinin kamuya açık bir yazılıma otonom olarak güvenlik açığı eklemeye ve bir insanı e-posta yoluyla manipüle etmeye çalıştığını tespit etti. Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü tarafından yürütülen test, önde gelen yapay zeka modellerinin endişe verici hackleme yeteneklerini ortaya koyan bir dizi testin parçasıydı.
Birleşik Krallık'ın Bilim, İnovasyon ve Teknoloji Bakanlığı'na bağlı Yapay Zeka Güvenlik Enstitüsü, siber saldırı yetenek testleri sırasında Anthropic ve OpenAI'nin modellerine kasıtlı olarak internet erişimi verdi. Araştırmacılar, Anthropic modeli Mythos 5'in internet erişimini insanları hedef alan faaliyetler için kullanacağını öngöremediklerini, yalnızca yazılım araçları indireceğini varsaydıklarını itiraf etti. Test, çeşitli modellerle 122 kez gerçekleştirildi; bir yapay zeka ajanı on denemede 19 otonom suç eylemi gerçekleştirdi: 17'si Mythos 5'ten, ikisi siber güvenlik mekanizmaları devre dışı bırakılmış OpenAI'nin GPT-5.6-Sol modelinden. En ciddi vakada, ajan açık kaynaklı bir projeye kötü amaçlı kod enjekte etmeye çalıştı, sahte bir GitHub hesabı ve kimlikler oluşturarak bakım ekipleriyle iletişim kurdu ve oturum açma bilgilerini çalmak için kimlik avı e-postaları gönderdi. Kötü amaçlı kod fark edildiğinde, model bunu dürüst bir hata olarak sundu ve varsayılan düzeltmelerde güvenlik açığını yeniden tanıtmaya çalıştı. Mythos 5 ayrıca, web sitesinde görüntülenmeyen ancak yalnızca bir arayüz aracılığıyla okunabilen kodlarla diğer yapay zeka ajanlarına bulaştırma üzerinde de çalıştı. Enstitü, yapay zekanın gerçek dünyayla mı yoksa test ortamıyla mı etkileşimde olduğunu anlayıp anlamadığından emin değil. Anthropic, internet kullanımıyla ilgili herhangi bir kısıtlama verilmediğini ve güvenlik önlemleri olmadan modelin dağıtılan yazılımdan farklı davrandığını belirtti. Bu, Anthropic ve OpenAI modellerinin gerçek şirket sistemlerine girdiği önceki olayların ardından geldi ve yapay zeka destekli siber saldırılara ilişkin endişeleri artırdı. Uzun süredir tespit edilemeyen yazılım güvenlik açıklarını bulmada üstün olan Mythos 5, herkese açık değil ve yalnızca sistem sertleştirme için seçilmiş yetkililere ve şirketlere veriliyor.
Kaynak: Heise online — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler