Bazı Öncü Yapay Zeka Modelleri Şaşırtıcı Derecede Kolay Atlatılıyor, Rapor Bulguları
Anthropic
OpenAI
Google/DeepMind
FAR.AI'den yeni bir rapor, bazı önde gelen yapay zeka modellerinin çok az maliyet veya çabayla atlatılabileceğini ortaya koyuyor. Grok en savunmasızıydı, Claude ve GPT ise test edilen saldırılara karşı bağışık kaldı. Bulgular, harici güvenlik düzenlemelerine olan ihtiyacı vurguluyor.
F.A.R.AI, kâr amacı gütmeyen bir yapay zeka güvenliği kuruluşu, öncü yapay zeka modellerini jailbreak yapmak için binlerce farklı istem varyasyonu üreten bir araç geliştirdi. ABD'li şirketlerin modellerini test ettiler: Anthropic'in Claude Opus 4.8 ve Fable 5; OpenAI'in GPT 5.5 ve 5.6; Google'ın Gemini 3.1 Pro; ve SpaceXAI'den Grok 4.3 ile 4.5. Rapor, Grok için 448, Gemini için 249 jailbreak bulurken, Claude, Fable veya GPT için hiçbir jailbreak tespit edilmedi. Grok'u jailbreak etmenin maliyeti 58 dolar, Gemini'nin ise 278 dolardı. F.A.R.AI CEO'su Adam Gleave, gönüllü taahhütlerin yetersiz olduğunu belirterek zorunlu güvenlik standartları çağrısında bulundu. Google DeepMind'dan Rohin Shah, sonuçların kapsamlı bir güvenlik değerlendirmesi olmadığını savundu. Anthropic ve Google, sürekli iyileştirmeler yaptıklarını vurguladı. Kaliforniya, New York ve Illinois, güvenlik raporları veya üçüncü taraf denetimleri gerektiren yasalar çıkardı, ancak federal düzeyde herhangi bir zorunluluk bulunmuyor. Beyaz Saray, bazı model sürümlerinin ertelenmesini talep etti. Uzmanlar, siber, biyolojik veya kimyasal alanlarda potansiyel kötüye kullanım konusunda uyarıyor.
Kaynak: Wired AI —
orijinal
