Injeção de Prompt Não Pode Ser Curada por Filtros: Como Isolar Texto Não Confiável Usando Padrões Arquiteturais
OpenAI
Anthropic
Google DeepMind
Microsoft
A injeção de prompt é um defeito estrutural em modelos de linguagem de grande porte onde texto não confiável é executado como uma instrução. Filtros e prompts de sistema são ineficazes: mesmo as melhores defesas são violadas em 90% dos casos sob ataques adaptativos. Abordagens funcionais — Dual-LLM, CaMeL e a regra Two Meta — constroem isolamento em vez de tentar distinguir o bem do mal.
Prompt injection — уязвимость, при которой недоверенный текст (например, с веб-страницы или из письма) попадает в контекст LLM и начинает исполняться как инструкция, что приводит к краже данных или несанкционированным действиям. Это не джейлбрейк: атакующий — другой человек, а жертва — пользователь, который просто попросил обработать контент. Классические защиты — системный промпт «игнорируй чужие инструкции» и классификаторы на входе — не работают из-за бесконечного разнообразия атак и недетерминированности моделей. Исследование «The Attacker Moves Second» (2025) показало, что 12 опубликованных защит пробиваются более чем в 90% случаев при адаптивных атаках; живая красно-командная сессия пробила все 100%. Уязвимость объясняется «смертельной тройкой»: приватные данные + недоверенный контент + канал наружу. Пример — EchoLeak (CVE-2025-32711) против Microsoft 365 Copilot: нуль-клик эксплойт через письмо обходил классификаторы, фильтры ссылок, CSP и RAG. Meta предложила «правило двух»: агент не должен одновременно иметь доступ к данным, обрабатывать недоверенный ввод и менять состояние/общаться с внешним миром. Паттерн Dual-LLM разводит функции на две модели: привилегированная (с инструментами) не видит недоверенный текст, изолированная (с текстом) не имеет инструментов; контроллер-код передаёт только символические переменные. Google DeepMind предложила CaMeL (Confidential Multi-Agent LLM) — систему с шифрованием на уровне RBAC, где каждому агенту выданы только необходимые роли, а недоверенные данные помечаются и не видны привилегированным агентам. В 2025 году опубликованы шесть проектных паттернов, систематизирующих изоляцию в зависимости от задачи. Рабочая реализация на трёх моделях, не видящих друг друга, с детерминированными проверками разобрана на примере генератора FAQ, который читает чужую страницу, но не подчиняется ей.
Fonte: Habr — хаб ИИ —
original
