Yapay Zeka GüvenliğiAraştırma 🇺🇸 12.08.2026 04:03

Yeni Yöntem, Sınır Yapay Zeka Modellerinden Gizli Muhakemeyi Çıkarıyor

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
Araştırmacılar, sınır yapay zeka modellerinin gizli muhakemesini çıkarmanın bir yolunu buldu; bu, damıtma saldırılarını mümkün kılabilir ve özel bilgileri açığa çıkarabilir. Sorunu OpenAI, Anthropic ve Google'daki modellerde tespit ettiler ve Çin modeli Kimi K3'ün Claude Opus ve GPT-5.6'ya çarpıcı biçimde benzer muhakeme ürettiğini buldular; ancak bu, damıtmanın kesin kanıtı değil. Şirketler güvenlik açığını azalttı ancak tam olarak düzeltmedi.
Bilgisayar bilimcileri, Tübingen Üniversitesi'nden Alexander Panfilov dahil, öncü yapay zeka modellerinin gizli 'düşünme' süreçlerini çıkarmak için bir yöntem keşfetti. Bu teknik, şirketlerin aynı şifre çözme anahtarını paylaşan ancak iç muhakemeyi açığa vurmaya daha istekli olan daha küçük, daha az uyumlu model varyantları sunması gerçeğinden yararlanıyor. Araştırmacılar, şifrelenmiş muhakeme izlerini bu daha küçük modellere besleyerek, daha büyük modellerin muhakemesini ortaya çıkarabildiler ve potansiyel olarak damıtma saldırılarını mümkün kılıp API anahtarları ve parolalar gibi kişisel bilgileri açığa çıkarabildiler. Moonshot AI'den Çin modeli Kimi K3'ün, Claude Opus 4.8 ve GPT-5.6 Sol'a çarpıcı biçimde benzer muhakeme ürettiğini buldular, ancak bunun nedensel olarak damıtmayı kanıtlamadığını belirttiler. Güvenlik açığı OpenAI, Anthropic ve Google'a bildirildi ve bu şirketler önlemler uyguladı, ancak Panfilov bazı muhakeme izlerinin hâlâ çıkarılabildiğini söylüyor. Bu konu, damıtmanın artan jeopolitik önemini vurguluyor; Çinli şirketler ABD modellerini kopyalamak için bunu kullanmakla suçlanıyor, ancak uzmanlar gerçek etkisi konusunda ikiye bölünmüş durumda.
Kaynak: Wired AI — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler