промптом и данными, а также обучение больших языковых моделей следовать инструкциям в любой части входных данных. Для решения этих проблем они представляют Secure Front-End, который использует специальные токены для разграничения промпта и данных, отфильтровывая любые разделители в данных. StruQ (Structured Instruction Tuning — структурированная настройка инструкций) симулирует инъекции промптов во время обучения, приучая большую языковую модель игнорировать внедрённые инструкции в части данных. SecAlign (Special Preference Optimization — специальная оптимизация предпочтений) идёт дальше, обучаясь как на желательных, так и на нежелательных ответах, используя оптимизацию предпочтений для создания большого разрыва в вероятности между ними. Эксперименты на Llama3-8B-Instruct показывают, что StruQ снижает показатель успешности атак до 45%, а SecAlign дополнительно снижает его до 8% против сложных атак. SecAlign сохраняет полезность, измеряемую с помощью AlpacaEval2, в то время как StruQ снижает её на 4,5%. Оба метода снижают показатель успешности атак без оптимизации почти до 0%, а SecAlign снижает показатель успешности атак на основе оптимизации более чем в 4 раза по сравнению с предыдущим современным уровнем.