Поймай jailbreak, если сможешь: как путаница ролей обходит защиту LLM
Jailbreak больших языковых моделей (LLM) — это не взлом, а социальная инженерия: атакующий меняет контекст запроса так, чтобы запрещённый ответ казался нормальным. Исследователи из работы Prompt Injection as Role Confusion показали, что модель может путать служебные метки ролей (system, user, assistant) со стилем текста, и если стиль похож на «внутреннее рассуждение», атака CoT Forgery достигает 60% успешности.
OpenAI
Anthropic

