AI安全研究 🇷🇺 24.07.2026 11:01

提示注入无法通过过滤器解决:如何利用架构模式隔离不可信文本

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
提示注入是大语言模型的结构性缺陷,其中不可信文本被当作指令执行。过滤器和系统提示无效:即使在自适应攻击下,最佳防御也在90%的案例中被攻破。可行的方案——双大语言模型、CaMeL和Two Meta规则——构建隔离而非试图区分善恶。
Prompt injection — уязвимость, при которой недоверенный текст (например, с веб-страницы или из письма) попадает в контекст LLM и начинает исполняться как инструкция, что приводит к краже данных или несанкционированным действиям. Это не джейлбрейк: атакующий — другой человек, а жертва — пользователь, который просто попросил обработать контент. Классические защиты — системный промпт «игнорируй чужие инструкции» и классификаторы на входе — не работают из-за бесконечного разнообразия атак и недетерминированности моделей. Исследование «The Attacker Moves Second» (2025) показало, что 12 опубликованных защит пробиваются более чем в 90% случаев при адаптивных атаках; живая красно-командная сессия пробила все 100%. Уязвимость объясняется «смертельной тройкой»: приватные данные + недоверенный контент + канал наружу. Пример — EchoLeak (CVE-2025-32711) против Microsoft 365 Copilot: нуль-клик эксплойт через письмо обходил классификаторы, фильтры ссылок, CSP и RAG. Meta предложила «правило двух»: агент не должен одновременно иметь доступ к данным, обрабатывать недоверенный ввод и менять состояние/общаться с внешним миром. Паттерн Dual-LLM разводит функции на две модели: привилегированная (с инструментами) не видит недоверенный текст, изолированная (с текстом) не имеет инструментов; контроллер-код передаёт только символические переменные. Google DeepMind предложила CaMeL (Confidential Multi-Agent LLM) — систему с шифрованием на уровне RBAC, где каждому агенту выданы только необходимые роли, а недоверенные данные помечаются и не видны привилегированным агентам. В 2025 году опубликованы шесть проектных паттернов, систематизирующих изоляцию в зависимости от задачи. Рабочая реализация на трёх моделях, не видящих друг друга, с детерминированными проверками разобрана на примере генератора FAQ, который читает чужую страницу, но не подчиняется ей.
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻