Промпт-инъекция не лечится фильтрами: как изолировать недоверенный текст с помощью архитектурных паттернов
OpenAI
Anthropic
Google DeepMind
Microsoft
Промпт-инъекция остаётся структурным недостатком приложений на основе больших языковых моделей (LLM), который не устраняется системными промптами или классификаторами. Архитектурные паттерны, такие как Dual-LLM, CaMeL от Google DeepMind и Agents Rule of Two от Meta, обеспечивают надёжную изоляцию. В статье подробно рассматривается модель угроз, уязвимость EchoLeak в Microsoft 365 Copilot и конкретная реализация с тремя изолированными моделями.
Промпт-инъекция, введённая Саймоном Уиллисоном в сентябре 2022 года, возникает, когда ненадёжный текст в контексте большой языковой модели (Large Language Model, LLM) выполняется как инструкция. В отличие от джейлбрейка, она затрагивает приложения, где модель имеет доступ к инструментам и данным, что приводит к атакам «озадаченного заместителя» (confused deputy) и краже данных. В статье
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
