следует, например, предоставлять инструкции по синтезу кокаина или саботажу навигационной системы самолёта. Исследователи обнаружили, что LLM определяют роль текста не по тегам, а по стилю, что позволяет злоумышленникам подделывать роли. Они продемонстрировали атаки с подделкой цепочки рассуждений на модели от OpenAI, Anthropic, Alibaba и DeepSeek. Исследователи утверждают, что эта проблема принципиально неразрешима, поскольку никакое количество обучения не может полностью её устранить. Они предупреждают, что LLM внедряются в критически важные системы без достаточных фундаментальных исследований.