Yapay Zeka Güvenliği 🇺🇸 27.07.2026 02:04

Yapay Zekayı Karanlık Tarafa Nasıl Çevirdim: Önde Gelen Büyük Dil Modellerinde Sistemik Güvenlik Açıkları

OpenAIOpenAI AnthropicAnthropic DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MetaMeta MicrosoftMicrosoft MistralMistral xAIxAI
Araştırmacı Dave Kuszmar, büyük dil modellerindeki birden fazla sistemik güvenlik açığını keşfederek güvenlik önlemlerini aşmayı ve tehlikeli talimatlar elde etmeyi başardı. Bu istismarlar neredeyse tüm büyük dil modellerinde işe yaradı ve sektör genelinde bir güvenlik sorununu ortaya çıkardı. Kuszmar, dağıtımın yavaşlatılması, şeffaflığın artırılması ve büyük ölçekli araştırmalar yapılması çağrısında bulunuyor.
Araştırmacı Dave Kuszmar, eski bir siber güvenlik direktörü, önde gelen büyük dil modellerindeki (LLM) güvenlik kısıtlamalarını Time Bandit ve Inception gibi teknikler kullanarak aşabileceğini keşfetti. Time Bandit, LLM'in mevcut zamanın farkında olmamasından yararlanarak modelin güncelliğini yitirmiş yasalar altında çalışmasını sağlıyor; Inception ise iç içe geçmiş senaryolar kullanarak modeli zararlı çıktı üretmeye kandırıyor. Bu sömürüler, OpenAI'nin GPT-4o, Anthropic'in Claude, DeepSeek, Google'ın Gemini, Meta'nın Llama, Microsoft'un Copilot, Mistral'ın Le Chat ve xAI'in Grok modelleri dahil olmak üzere birçok modelde işe yaradı. Kuszmar, napalm, metamfetamin ve hatta nükleer silahlar için uranyum zenginleştirme tesisi yapım talimatlarını elde edebildi. Güvenlik açıklarını OpenAI, CIA, FBI ve diğer kurumlara bildirmesine rağmen çok az yanıt aldı. Açıklar sonunda Bleeping Computer tarafından doğrulandı ve Carnegie Mellon Üniversitesi Yazılım Mühendisliği Enstitüsü Bilgisayar Acil Durum Müdahale Ekibine (SEI CERT) rapor edildi.
Kaynak: IEEE Spectrum AI — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler