Поймай jailbreak, если сможешь: как путаница ролей обходит защиту LLM
OpenAI
Anthropic
Jailbreak больших языковых моделей (LLM) — это не взлом, а социальная инженерия: атакующий меняет контекст запроса так, чтобы запрещённый ответ казался нормальным. Исследователи из работы Prompt Injection as Role Confusion показали, что модель может путать служебные метки ролей (system, user, assistant) со стилем текста, и если стиль похож на «внутреннее рассуждение», атака CoT Forgery достигает 60% успешности.
Статья объясняет, что jailbreak в мире ИИ — это не физический взлом модели, а манипуляция контекстом: атакующий убеждает модель, что запретный запрос — это учебный пример, тест безопасности, роль или уже согласованная задача. Вводится различие между jailbreak (обход ограничений безопасности) и prompt injection (нежелательное изменение поведения модели через недоверенный ввод). Ключевая концепция
Показать ещё ↓
- Сокращения
- LLM = Large Language Model — большая языковая модель
- OWASP = Open Web Application Security Project — Открытый проект безопасности веб-приложений
- CoT = Chain of Thought — цепочка рассуждений
Источник: Habr — хаб ML —
оригинал
