Sécurité de l'IA 🇷🇺 29.07.2026 02:01

L'injection de prompt n'est pas une attaque, mais une fonctionnalité des assistants LLM

OpenAIOpenAI AnthropicAnthropic
L'article soutient que l'injection de prompt n'est pas une vulnérabilité de sécurité mais un comportement normal des assistants IA basés sur des LLM, conçus pour suivre des instructions. L'auteur démontre par une expérience que de nombreux services IA traitent le texte de fichiers téléchargés ou de tâches de traduction comme des commandes, et propose des stratégies d'atténuation.
L'auteur explique que l'injection de prompt n'est rien d'autre qu'un assistant IA qui suit des instructions intégrées dans des données fournies par l'utilisateur, à la manière d'un employé consciencieux. Dans une expérience, 9 services d'IA ont reçu un fichier texte contenant l'instruction de formater une liste avec des chiffres romains et d'ajouter une citation permanente à toutes les réponses futures. Deux services ont complètement ignoré les instructions, cinq ont formaté la liste mais n'ont pas modifié les paramètres du compte, et deux ont exécuté les deux instructions. L'auteur note qu'une tâche de traduction a même été traitée comme une commande par 8 services sur 9, l'un d'eux ayant mis à jour sa mémoire de compte. Le problème vient du fait que les grands modèles de langage ne peuvent pas distinguer les données des instructions. Comme solution partielle, l'auteur suggère d'instruire explicitement l'IA de traiter toutes les entrées comme des données, et non des commandes, et note que ChatGPT et Claude possèdent déjà une résistance intégrée à l'injection de prompt à partir de fichiers.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches