Prompt injection не лечится фильтрами: как изолировать недоверенный текст с помощью архитектурных паттернов

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Prompt injection — структурный дефект LLM, при котором недоверенный текст исполняется как инструкция. Фильтры и системные промпты неэффективны: даже лучшие защиты пробиваются в 90% случаев при адаптивных атаках. Рабочие подходы — Dual-LLM, CaMeL и правило двух Meta — строят изоляцию, а не пытаются отличить добро от зла.
Prompt injection — уязвимость, при которой недоверенный текст (например, с веб-страницы или из письма) попадает в контекст LLM и начинает исполняться как инструкция, что приводит к краже данных или несанкционированным действиям. Это не джейлбрейк: атакующий — другой человек, а жертва — пользователь, который просто попросил обработать контент. Классические защиты — системный промпт «игнорируй
Показать ещё ↓
Сокращения
CVE = Common Vulnerabilities and Exposures — общие уязвимости и экспозиции
RBAC = Role-Based Access Control — управление доступом на основе ролей
RAG = Retrieval-Augmented Generation — генерация с дополнением извлечением
CSP = Content Security Policy — политика безопасности контента
SQL = Structured Query Language — язык структурированных запросов
HTTP = HyperText Transfer Protocol — протокол передачи гипертекста
URL = Uniform Resource Locator — единый указатель ресурса
JSON = JavaScript Object Notation — нотация объектов JavaScript
ID = Identifier — идентификатор
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости