Защита от инъекций промптов с помощью StruQ и SecAlign

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR) MetaMeta OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Исследователи из BAIR (Berkeley AI) предложили два метода тонкой настройки для защиты от инъекций промптов: StruQ (структурированная настройка инструкций) и SecAlign (специальная оптимизация предпочтений). Методы основаны на разделении промпта и данных с помощью специальных токенов-разделителей и обучении модели игнорировать встроенные инструкции. Эксперименты показали, что SecAlign снижает успешность атак до 8%, а StruQ – до 45%, при этом сохраняя общую полезность модели.
Инъекции промптов, признанные OWASP самой серьёзной угрозой для приложений на основе больших языковых моделей (LLM), возникают из-за того, что во входных данных модели нет разделения между доверенной инструкцией и недоверенными данными, а сами LLM обучены выполнять инструкции из любой части ввода. Для защиты исследователи из BAIR (Berkeley AI) предложили два подхода к тонкой настройке: StruQ (Structured Instruction Tuning) и SecAlign (Special Preference Optimization). Оба метода используют защищённый фронт-энд (Secure Front-End), который резервирует специальные токены-разделители и фильтрует их из данных, обеспечивая явное разделение. StruQ имитирует инъекции промптов в обучающих данных, используя контролируемую тонкую настройку, чтобы модель училась отвечать только на предназначенную инструкцию. SecAlign применяет оптимизацию предпочтений (DPO) на парах желательных и нежелательных ответов, создавая больший вероятностный разрыв между ними, что даёт более высокую устойчивость. В экспериментах на Llama3-8B-Instruct успешность оптимизационных атак (ASR) снизилась до 8% для SecAlign и до 45% для StruQ, а для безусловных атак – примерно до 0% в обоих случаях. При этом общая полезность модели, оценённая по AlpacaEval2, практически не пострадала. Авторы также опубликовали код обоих методов и пятишаговое руководство по обучению безопасной LLM с помощью SecAlign.
Сокращения
OWASP = Open Web Application Security Project — Открытый проект безопасности веб-приложений
LLM = Large Language Model — большая языковая модель
ASR = Attack Success Rate — коэффициент успешности атаки
DPO = Direct Preference Optimization — прямая оптимизация предпочтений
Источник: BAIR (Berkeley AI) — оригинал

Наши прошлые публикации по теме

Есть свежие новости