Prompt-injectie kan niet worden genezen door filters: hoe u onvertrouwde tekst isoleert met architectuurpatronen
OpenAI
Anthropic
Google DeepMind
Microsoft
Prompt-injectie is een structureel defect in grote taalmodellen waarbij onvertrouwde tekst als instructie wordt uitgevoerd. Filters en systeemprompts zijn niet effectief: zelfs de beste verdedigingen worden in 90% van de gevallen doorbroken bij adaptieve aanvallen. Werkende benaderingen—Dual-LLM, CaMeL en de Twee Meta-regel—bouwen isolatie op in plaats van te proberen goed van kwaad te onderscheiden.
Prompt injection — уязвимость, при которой недоверенный текст (например, с веб-страницы или из письма) попадает в контекст LLM и начинает исполняться как инструкция, что приводит к краже данных или несанкционированным действиям. Это не джейлбрейк: атакующий — другой человек, а жертва — пользователь, который просто попросил обработать контент. Классические защиты — системный промпт «игнорируй чужие инструкции» и классификаторы на входе — не работают из-за бесконечного разнообразия атак и недетерминированности моделей. Исследование «The Attacker Moves Second» (2025) показало, что 12 опубликованных защит пробиваются более чем в 90% случаев при адаптивных атаках; живая красно-командная сессия пробила все 100%. Уязвимость объясняется «смертельной тройкой»: приватные данные + недоверенный контент + канал наружу. Пример — EchoLeak (CVE-2025-32711) против Microsoft 365 Copilot: нуль-клик эксплойт через письмо обходил классификаторы, фильтры ссылок, CSP и RAG. Meta предложила «правило двух»: агент не должен одновременно иметь доступ к данным, обрабатывать недоверенный ввод и менять состояние/общаться с внешним миром. Паттерн Dual-LLM разводит функции на две модели: привилегированная (с инструментами) не видит недоверенный текст, изолированная (с текстом) не имеет инструментов; контроллер-код передаёт только символические переменные. Google DeepMind предложила CaMeL (Confidential Multi-Agent LLM) — систему с шифрованием на уровне RBAC, где каждому агенту выданы только необходимые роли, а недоверенные данные помечаются и не видны привилегированным агентам. В 2025 году опубликованы шесть проектных паттернов, систематизирующих изоляцию в зависимости от задачи. Рабочая реализация на трёх моделях, не видящих друг друга, с детерминированными проверками разобрана на примере генератора FAQ, который читает чужую страницу, но не подчиняется ей.
Bron: Habr — хаб ИИ —
origineel
