StruQ и SecAlign: защита от атак с внедрением подсказок

MetaMeta OpenAIOpenAI
Исследователи из BAIR (Berkeley Artificial Intelligence Research) предлагают два метода тонкой настройки, StruQ и SecAlign, для защиты от атак с внедрением подсказок в приложениях, интегрированных с большими языковыми моделями (LLM). StruQ использует структурированную настройку инструкций для игнорирования внедрённых инструкций, в то время как SecAlign применяет оптимизацию предпочтений для достижения лучшей устойчивости, снижая уровень успешности атак почти до 0% для атак без оптимизации и ниже 15% для атак, основанных на оптимизации.
Инъекция промптов, когда ненадёжные данные содержат инструкцию, переопределяющую заложенную системой цель, признана OWASP (Open Web Application Security Project) главной угрозой для приложений, интегрированных с большими языковыми моделями. Промышленные системы, такие как Google Docs, Slack AI и ChatGPT, были продемонстрированы уязвимыми. Авторы предлагают две причины: отсутствие разделения между
Показать ещё ↓
Источник: BAIR (Berkeley AI) — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости