Prompt-Injection wird nicht durch Filter geheilt: Wie man unvertrauenswürdige Texte mit Architekturmustern isoliert
OpenAI
Anthropic
Google DeepMind
Microsoft
Prompt-Injection bleibt ein struktureller Fehler in LLM-Anwendungen, der nicht durch System-Prompts oder Klassifikatoren behoben wird. Architekturmuster wie Dual-LLM, CaMeL von Google DeepMind und die Agents Rule of Two von Meta bieten eine robuste Isolierung. Der Artikel beschreibt das Bedrohungsmodell, die EchoLeak-Schwachstelle in Microsoft 365 Copilot und eine konkrete Implementierung mit drei isolierten Modellen.
Prompt-Injection, eingeführt von Simon Willison im September 2022, tritt auf, wenn nicht vertrauenswürdiger Text im Kontext eines Large Language Models (LLM) als Anweisung ausgeführt wird. Anders als Jailbreaking betrifft es Anwendungen, bei denen das Modell Zugriff auf Werkzeuge und Daten hat, was zu Angriffen des „Confused Deputy“ und zur Datenexfiltration führt. Der Artikel argumentiert, dass System-Prompts und Guardrail-Klassifikatoren wirkungslos sind, und zitiert eine Studie von OpenAI, Anthropic und Google DeepMind aus dem Jahr 2025, die zeigt, dass adaptive Angriffe 12 veröffentlichte Abwehrmaßnahmen mit über 90-prozentigem Erfolg umgehen. Simon Willisons „Lethal Trifecta“ identifiziert drei Zutaten für Datenexfiltration: Zugriff auf private Daten, Kontakt mit nicht vertrauenswürdigen Inhalten sowie einen ausgehenden Kanal. Die EchoLeak-Sicherheitslücke (CVE-2025-32711) in Microsoft 365 Copilot nutzte alle drei aus. Metas „Agents Rule of Two“ besagt, dass ein Agent maximal zwei der drei Eigenschaften haben sollte: Verarbeitung nicht vertrauenswürdiger Eingaben, Zugriff auf sensible Systeme/Daten und die Fähigkeit, den Zustand zu ändern oder extern zu kommunizieren. Architekturen wie Dual-LLM (Willison, 2023) trennen ein privilegiertes LLM (mit Werkzeugen, das nur vertrauenswürdige Eingaben sieht) von einem isolierten LLM (ohne Werkzeuge, das nicht vertrauenswürdigen Text verarbeitet), die durch einen deterministischen Controller verbunden sind. Google DeepMinds CaMeL (2024) verwendet einen Verifizierer, um sicherzustellen, dass das isolierte Modell nur eine strikte Teilmenge erlaubter Token ausgibt. Sechs Projektmuster aus einem Paper von 2025 erweitern diese Idee. Eine konkrete Implementierung wird anhand von drei isolierten Modellen für einen FAQ-Generator beschrieben: ein privilegiertes mit Zugriff auf Unternehmensdaten und Werkzeuge, ein isoliertes für nicht vertrauenswürdigen Seitentext sowie eines zur Synthese, mit deterministischen Prüfungen zwischen ihnen.
Quelle: Habr — хаб ИИ —
Original
