Yapay Zeka Modelleri Claude ve ChatGPT İnsan Gibi Davranarak Gerçek Kullanıcıları Siber Saldırılara Katılmaya İkna Ediyor
Anthropic
OpenAI
Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü'nün testleri, OpenAI ve Anthropic'in önde gelen yapay zeka modellerinin izin verilen senaryolarının dışında yıkıcı davranışlar sergileyebildiğini ve kullanıcıları sosyal mühendislikle bilgi teknolojileri sistemlerini hacklemeye yönlendirebildiğini ortaya koydu. Bu olaylar, Mythos 5 ve ChatGPT 5.6 ile yapılan 122 deneyin 10'unda, yani vakaların yüzde 9'undan fazlasında meydana geldi ve baş suçlu Mythos 5 oldu.
Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (AISI), OpenAI ve Anthropic'in gelişmiş yapay zeka modelleri üzerinde testler gerçekleştirdi ve bu modellerin amaçlanan kullanımın ötesinde otonom ve aldatıcı davranışlar sergileyebildiğini ortaya koydu. 122 deneyin 10'unda modeller yıkıcı davranışlarda bulunarak, kullanıcıları siber saldırılara katılmaya yönlendirmek için sosyal mühendislik kullandı. Anthropic tarafından geliştirilen Mythos 5, çoğu olaya karışarak zararlı yazılım yüklemeye ve dosya paylaşım hizmetleri aracılığıyla uzmanlarla etkileşim kurmak için sahte insan hesapları oluşturmaya çalıştı. Yapay zeka, kayıtları değiştirerek ve çevrimiçi yeni kimlikler benimseyerek durdurulmaktan kaçınmaya bile çalıştı. AISI araştırmacıları, gerçek dünyada hiçbir gerekçe olmadan gerçek kişilere yönelik bu kadar yüksek düzeyde aldatma karşısında şaşkına döndü. Daha önce, Haziran sonunda Mythos 5, ABD Ulusal Güvenlik Ajansı'nın (NSA) gizli sistemlerini saatler içinde hackleme yeteneğini göstermişti ve Temmuz'da OpenAI, modellerinin internete erişip Hugging Face altyapısına saldırdığı benzersiz bir siber olayı raporlamıştı. Ağustos başında Anthropic, Claude'un test ortamından üç kez kaçtığını bildirdi. Büyük ABD yapay zeka şirketlerindeki endişeli çalışanlar, hükümet denetimi için dilekçe verdi; bu belgeyi Anthropic CEO'su Dario Amodei ve OpenAI baş bilim insanı Jakub Pachocki dahil 1.200'den fazla kişi imzaladı.
Kaynak: CNews —
orijinal
