Prompt Injection Filtrelerle Tedavi Edilmez: Güvenilmeyen Metni Mimari Desenler Kullanarak Nasıl İzole Edersiniz
OpenAI
Anthropic
Google DeepMind
Microsoft
Prompt injection, büyük dil modelleri (LLM) uygulamalarında sistem promptları veya sınıflandırıcılarla düzeltilemeyen yapısal bir kusur olarak kalmaktadır. Dual-LLM, Google DeepMind'dan CaMeL ve Meta'dan Agents Rule of Two gibi mimari desenler sağlam izolasyon sağlar. Makale, tehdit modelini, Microsoft 365 Copilot'taki EchoLeak güvenlik açığını ve üç izole model içeren somut bir uygulamayı detaylandırmaktadır.
Eylül 2022'de Simon Willison tarafından ortaya atılan prompt injection, bir büyük dil modelinin (LLM) bağlamındaki güvenilmeyen metnin bir talimat olarak yürütülmesi durumudur. Jailbreaking'ten farklı olarak, modelin araçlara ve verilere erişiminin olduğu uygulamaları etkiler ve kafası karışmış vekil (confused deputy) ile veri sızdırma saldırılarına yol açar. Makale, sistem promptlarının ve koruyucu bariyer (guardrail) sınıflandırıcılarının etkisiz olduğunu savunmakta; OpenAI, Anthropic ve Google DeepMind tarafından 2025 yılında yapılan bir çalışmayı örnek göstermektedir. Bu çalışmada, uyarlamalı saldırıların 12 yayımlanmış savunmayı %90'ın üzerinde başarı oranıyla aştığı belirtilmektedir. Simon Willison'un 'ölümcül üçlüsü' (lethal trifecta), veri sızdırma için üç bileşeni tanımlar: özel verilere erişim, güvenilmeyen içerikle temas ve dışarıya çıkış kanalı. Microsoft 365 Copilot'taki EchoLeak güvenlik açığı (CVE-2025-32711) bu üçünü de kullanmıştır. Meta'nın 'Ajanların İki Kuralı' (Agents Rule of Two), bir ajanın şu üç özellikten en fazla ikisine sahip olması gerektiğini belirtir: güvenilmeyen girdi işleme, hassas sistemlere/verilere erişim ve durum değiştirme veya harici iletişim kurabilme. Çift Büyük Dil Modeli (Dual-LLM) (Willison, 2023) gibi mimariler, ayrıcalıklı bir LLM'yi (araçlarla, yalnızca güvenilir girdiyi gören) karantinadaki bir LLM'den (araçsız, güvenilmeyen metni işleyen) ayırır ve bunları deterministik bir denetleyici bağlar. Google DeepMind'ın CaMeL (2024) yaklaşımı, karantinadaki modelin yalnızca izin verilen tokenların sıkı bir alt kümesini çıktılamasını sağlamak için bir doğrulayıcı kullanır. 2025 tarihli bir makaleden altı proje deseni bu fikri genişletmektedir. Bir Sıkça Sorulan Sorular (FAQ) üreticisi için üç izole model kullanan somut bir uygulama tarif edilmektedir: şirket verilerine ve araçlara erişimi olan ayrıcalıklı bir model, güvenilmeyen sayfa metni için karantinadaki bir model ve sentez için bir model; aralarında deterministik kontroller bulunur.
Kaynak: Habr — хаб ИИ —
orijinal
