Prompt injection не лечится фильтрами: как изолировать недоверенный текст с помощью архитектурных паттернов
Prompt injection — структурный дефект LLM, при котором недоверенный текст исполняется как инструкция. Фильтры и системные промпты неэффективны: даже лучшие защиты пробиваются в 90% случаев при адаптивных атаках. Рабочие подходы — Dual-LLM, CaMeL и правило двух Meta — строят изоляцию, а не пытаются отличить добро от зла.
OpenAI
Anthropic
Google DeepMind
Microsoft
Habr — хаб ИИ24.07 · 11:01
