инцидент на площади Тяньаньмэнь. Джейлбрейки работают, потому что безопасность LLM — это не отдельный модуль, а часть усвоенного поведения модели; джейлбрейк создаёт сильный контекстный сигнал, который смещает распределение вероятностей в сторону вредоносных результатов. Помимо джейлбрейков, существуют специализированные «чёрные» LLM, такие как WormGPT, EvilGPT, WolfGPT и DarkBERT, обученные специально для киберпреступности, хотя многие из них либо не действуют, либо являются мошенничеством. Защита включает архитектурное разделение системных и пользовательских промптов, фильтры ввода/вывода, такие как AVI (интерфейс проверки согласованности/соответствия) или Llama Guard, состязательную тонкую настройку, согласование через конституционный ИИ, анализ внутренней активации, защиту на основе RAG (генерация с дополнением по извлечённым данным) и тестирование с участием «красных команд». Для сбора данных в реальном времени о методах джейлбрейка Lakera запустила проект Gandalf — интерактивную игру, в которой участники взламывают имитированные ИИ-приложения, чтобы извлекать секреты или принуждать к вредоносному поведению, с таблицей лидеров для повышения вовлечённости.