StruQ et SecAlign : se défendre contre les attaques par injection de prompt
Meta
OpenAI
Des chercheurs de BAIR proposent deux défenses par réglage fin, StruQ et SecAlign, contre les attaques par injection de prompt dans les applications intégrant des LLM. StruQ utilise un réglage structuré des instructions pour ignorer les instructions injectées, tandis que SecAlign applique une optimisation des préférences pour atteindre une meilleure robustesse, réduisant les taux de succès des attaques à près de 0 % pour les attaques sans optimisation et à moins de 15 % pour les attaques basées sur l'optimisation.
L'injection de prompt, où des données non fiables contiennent une instruction qui outrepasse le prompt prévu par le système, est classée comme la menace n°1 par l'OWASP pour les applications intégrant des LLM. Des systèmes de niveau production comme Google Docs, Slack AI et ChatGPT se sont révélés vulnérables. Les auteurs proposent deux causes : le manque de séparation entre le prompt et les données, et le fait que les LLM sont entraînés à suivre des instructions où qu'elles se trouvent dans l'entrée. Pour y remédier, ils introduisent un Front-End Sécurisé qui utilise des tokens spéciaux pour délimiter le prompt et les données, en filtrant tout délimiteur présent dans les données. StruQ (Apprentissage par Instructions Structurées) simule des injections de prompt pendant l'entraînement, apprenant au LLM à ignorer les instructions injectées dans la partie données. SecAlign (Optimisation par Préférence Spéciale) va plus loin en s'entraînant à la fois sur des réponses souhaitables et non souhaitables, utilisant l'optimisation par préférence pour créer un grand écart de probabilité entre elles. Les expériences sur Llama3-8B-Instruct montrent que StruQ réduit le taux de réussite des attaques (ASR) à 45%, et SecAlign le réduit encore à 8% face à des attaques sophistiquées. SecAlign préserve l'utilité mesurée par AlpacaEval2, tandis que StruQ la diminue de 4,5%. Les deux réduisent les taux de réussite des attaques sans optimisation à près de 0%, et SecAlign réduit l'ASR des attaques basées sur l'optimisation d'un facteur supérieur à 4 par rapport à l'état de l'art précédent.
Source: BAIR (Berkeley AI) —
original
