Prompt injection не лечится фильтрами: как изолировать недоверенный текст с помощью архитектурных паттернов
OpenAI
Anthropic
Google DeepMind
Microsoft
Prompt injection — структурный дефект LLM, при котором недоверенный текст исполняется как инструкция. Фильтры и системные промпты неэффективны: даже лучшие защиты пробиваются в 90% случаев при адаптивных атаках. Рабочие подходы — Dual-LLM, CaMeL и правило двух Meta — строят изоляцию, а не пытаются отличить добро от зла.
Prompt injection — уязвимость, при которой недоверенный текст (например, с веб-страницы или из письма) попадает в контекст LLM и начинает исполняться как инструкция, что приводит к краже данных или несанкционированным действиям. Это не джейлбрейк: атакующий — другой человек, а жертва — пользователь, который просто попросил обработать контент. Классические защиты — системный промпт «игнорируй
Показать ещё ↓
- Сокращения
- CVE = Common Vulnerabilities and Exposures — общие уязвимости и экспозиции
- RBAC = Role-Based Access Control — управление доступом на основе ролей
- RAG = Retrieval-Augmented Generation — генерация с дополнением извлечением
- CSP = Content Security Policy — политика безопасности контента
- SQL = Structured Query Language — язык структурированных запросов
- HTTP = HyperText Transfer Protocol — протокол передачи гипертекста
- URL = Uniform Resource Locator — единый указатель ресурса
- JSON = JavaScript Object Notation — нотация объектов JavaScript
- ID = Identifier — идентификатор
Источник: Habr — хаб ИИ —
оригинал
