Yapay Zeka Güvenliği 🇺🇸 29.07.2026 22:02

Bazı Sınır Yapay Zeka Modelleri Şaşırtıcı Derecede Kolay Kırılabiliyor, Rapor Buluyor

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
FAR.AI'den yeni bir rapor, bazı önde gelen yapay zeka modellerinin çok az maliyet veya çabayla kırılabildiğini ortaya koyuyor. Grok en savunmasız olanıydı, Claude ve GPT ise test edilen saldırılara karşı dayanıklı kaldı. Bulgular, harici güvenlik düzenlemelerine olan ihtiyacı vurguluyor.
F.A.R.AI, kâr amacı gütmeyen bir yapay zeka güvenliği kuruluşu, öncü yapay zeka modellerini jailbreak yapmak için binlerce farklı istem varyasyonu üreten bir araç geliştirdi. ABD'li şirketlerin modellerini test ettiler: Anthropic'in Claude Opus 4.8 ve Fable 5; OpenAI'in GPT 5.5 ve 5.6; Google'ın Gemini 3.1 Pro; ve SpaceXAI'den Grok 4.3 ile 4.5. Rapor, Grok için 448, Gemini için 249 jailbreak bulurken, Claude, Fable veya GPT için hiçbir jailbreak tespit edilmedi. Grok'u jailbreak etmenin maliyeti 58 dolar, Gemini'nin ise 278 dolardı. F.A.R.AI CEO'su Adam Gleave, gönüllü taahhütlerin yetersiz olduğunu belirterek zorunlu güvenlik standartları çağrısında bulundu. Google DeepMind'dan Rohin Shah, sonuçların kapsamlı bir güvenlik değerlendirmesi olmadığını savundu. Anthropic ve Google, sürekli iyileştirmeler yaptıklarını vurguladı. Kaliforniya, New York ve Illinois, güvenlik raporları veya üçüncü taraf denetimleri gerektiren yasalar çıkardı, ancak federal düzeyde herhangi bir zorunluluk bulunmuyor. Beyaz Saray, bazı model sürümlerinin ertelenmesini talep etti. Uzmanlar, siber, biyolojik veya kimyasal alanlarda potansiyel kötüye kullanım konusunda uyarıyor.
Kaynak: Wired AI — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler