Yapay Zeka Güvenliği 🇷🇺 11.08.2026 21:02

Yapay zekâ düşünceleri başka bir yapay zekâ ile okunabiliyor, içindeki şifreler ve anahtarlar ortaya çıkıyor

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Araştırmacılar, hedef modele saldırmadan, Anthropic, OpenAI ve Google'a ait tescilli büyük dil modellerinin gizli akıl yürütme izlerini iki API çağrısıyla çözen bir saldırı gösterdiler. Yöntem ayrıca, genel aracı (agent) günlüklerinin, şifrelenmiş blokların içinde gizlenmiş yüzlerce sırrı (şifreler ve anahtarlar dahil) içerdiğini buldu.
ELLIS Enstitüsü Tübingen, Max Planck Akıllı Sistemler Enstitüsü, Tübingen AI Merkezi, MATS ve Snyk'ten sekiz araştırmacı, 10 Ağustos'ta Anthropic, OpenAI ve Google'ın modellerinin şifrelenmiş akıl yürütme izlerine yönelik bir saldırıyı açıklayan bir ön baskı yayınladı. Saldırı, güçlü bir modelden (örneğin Claude Opus 4.8) alınan şifrelenmiş bloğun, aynı sağlayıcının daha zayıf bir modeline (örneğin Haiku 4.5) beslenmesi ve bu modelden akıl yürütmeyi kelimesi kelimesine yeniden yazmasının istenmesiyle çalışıyor; böylece blok şifresi çözülmüş oluyor. Saldırı, şifrelemeyi kırmıyor veya güçlü modele saldırmıyor; şifrelenmiş bloğun istemciye geri gönderilmesi ve sonraki istekle birlikte yeniden gönderilmesi gerektiği gerçeğinden yararlanıyor. Araştırmacılar, 120 Codeforces görevinde şifresi çözülen izlerin doğruluğunu doğruladı. Ayrıca GitHub ve Hugging Face'teki 6708 genel ajan günlüğünü tarayarak 315.320 akıl yürütme bloğu kurtardı; bu bloklarda 62 API anahtarı, 33 parola, 24 erişim belirteci ve e-posta, ad ve dahili URL'ler dahil 704 benzersiz sır bulunuyordu. Özellikle, bu sırların 64'ü görünür oturumda hiçbir yerde görünmüyordu; yalnızca şifrelenmiş blokların içinde mevcuttu. Makale ayrıca, daha sonra yükleyen bir ajana komut enjekte etmek için kötü niyetli bir bloğun yerleştirilebileceği bir zehirleme vektörünü de açıklıyor. Yazarlar, bloğu oturuma, kullanıcıya ve modele bağlamak için kriptografik ve sistem önlemleri öneriyor; ancak şimdilik kullanıcıların şifrelenmiş akıl yürütme bloklarını sır olarak ele alması ve günlükleri herkese açık paylaşmaktan kaçınması gerekiyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler