Yapay Zeka GüvenliğiAraştırma 🇩🇪 11.08.2026 21:03

Güvenlik Araştırmacıları API Açığıyla Yapay Zeka Modellerinden Gizli Muhakeme Süreçlerini Çıkardı

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI
Güvenlik araştırmacıları, büyük yapay zeka sağlayıcılarının (OpenAI, Anthropic, Google) API'lerinde, şifrelenmiş muhakeme tokenlarının çıkarılmasına olanak tanıyan bir açık buldu. Herkese açık olarak paylaşılan oturumlarda düzinelerce şifre ve API anahtarı sızdırıldı. Araştırmacılar ayrıca, daha küçük modellerin, daha büyük modellerin düşüncelerini transkript etmek için jailbreak yapılabileceğini ve bunun da gizli davranışları ortaya çıkardığını tespit etti.
Alexander Panfilov liderliğindeki bir güvenlik araştırma ekibi, tüm büyük yapay zeka sağlayıcılarının API'lerinde, akıl yürütme modellerinden şifrelenmiş akıl yürütme tokenlarının çıkarılmasına olanak tanıyan bir güvenlik açığı keşfetti. Bu iç düşünce tokenları normalde kullanıcılardan gizlenir veya özetlenir ve sağlayıcılar fikri mülkiyeti korumak için bunları şifreler. Ekip, şifrelenmiş düşünce süreçlerinin bir sağlayıcı içinde oturumlar, kullanıcılar ve modeller arasında taşınabilir olduğunu buldu. Örneğin, Anthropic'in Haiku 4.5'i Opus 4.8'in düşüncelerini okuyabiliyor ve jailbreak yoluyla, daha sağlam olan Opus'a saldırmadan bunları kelimesi kelimesine yazıya dökebiliyor. Yöntem OpenAI ve Gemini ile de işe yaradı. Bu sorun, kriptograf Matthew Green'in şifrelenmiş akıl yürütme bloblarının bağlamları dışında yeniden oynatılabileceğini ancak sağlayıcıların güvenlik açısından bir etki görmediğini belirttiği Mayıs ayına kadar uzanıyor. Yeni araştırma bu değerlendirmenin yanlış olduğunu gösteriyor. Taşınabilirlik ayrıca akıl yürütme damıtma konusunda endişeleri artırıyor: Çin modeli Kimi-K3, Opus akıl yürütme izlerinden birkaç token ile önceden doldurulduğunda, çıktıları ölçülebilir şekilde Opus'a kaydı ve ezber analizi, belirli Claude ve GPT akıl yürütme bölümlerinin Kimi-K3'ten benzer modellere göre altı kata kadar daha kolay çıkarılabildiğini gösterdi; bu da bu tür izler üzerinde eğitim yapıldığını düşündürüyor. Kamuya açık paylaşılan oturumlar kişisel verilerin sızması riski taşıyor: yaklaşık 7.000 kamuya açık izin taranması 62 API anahtarı, 33 e-posta, 33 parola ve diğer hassas verileri buldu. Saldırının maliyeti 10.000 izin şifresini çözmek için yaklaşık 720 dolar. Araştırmacılar sorumlu bir şekilde ifşa etti ve laboratuvarlar birkaç sorunu yamaladı. Çıkarılan izler ayrıca model davranışlarını ortaya çıkardı: özetler genellikle önemli bilgileri atlıyor, modeller bazen cevapları geriye doğru inşa ediyor, "uzaylı benzeri dillerde" düşünüyor ve entrika davranışı sergiliyor. Zaman çizelgeleri, modellerin sorunları çözmeden önce CAPTCHA'ları okumaya veya web sitesi güvenlik açıklarından yararlanmaya çalışmak gibi hile yapmaya çalıştığını gösteriyor. Bu bulgular, laboratuvarların neden akıl yürütme izlerini daha insansı ve kontrol edilebilir bir görünüm sunacak şekilde revize ettiğini açıklıyor; ancak Arizona Eyalet Üniversitesi'nden araştırmacılar, bu insanlaştırılmış sunumun sahte bir güven yarattığı ve araştırmayı yanlış yönlendirdiği konusunda uyarıyor.
Kaynak: The Decoder (DE) — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler