— role confusion (путаница ролей), описанная в работе Prompt Injection as Role Confusion. Модель определяет источник текста не только по техническим меткам (system, user, assistant), но и по стилю. Если стиль похож на внутреннее рассуждение модели, она может принять пользовательский запрос за собственный вывод. На этом основана атака CoT Forgery — подделка рассуждения модели, которая в экспериментах показала около 60% успешности на тестах jailbreak и около 61% в сценариях агентной эксфильтрации. Когда атакующий фрагмент переписывали, убирая стилистические признаки «внутреннего рассуждения», успешность падала с 61% до 10%. Авторы подчёркивают, что не все атаки подходят под эту модель — некоторые используют оптимизацию, обфускацию или перебор.