Sécurité de l'IAModèles 🇷🇺 24.07.2026 11:01

L'injection de prompt n'est pas corrigée par des filtres : comment isoler un texte non fiable à l'aide de motifs architecturaux

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
L'injection de prompt reste une faille structurelle dans les applications de LLM, non résolue par les invites système ou les classifieurs. Des motifs architecturaux comme Dual-LLM, CaMeL de Google DeepMind et la règle des deux agents de Meta offrent un isolement robuste. L'article détaille le modèle de menace, la vulnérabilité EchoLeak dans Microsoft 365 Copilot, et une implémentation concrète avec trois modèles isolés.
L'injection de prompt, introduite par Simon Willison en septembre 2022, se produit lorsqu'un texte non fiable dans le contexte d'un grand modèle de langage (LLM) est interprété comme une instruction. Contrairement au jailbreaking, elle affecte les applications où le modèle a accès à des outils et des données, conduisant à des attaques de type « député confus » et d'exfiltration de données. L'article soutient que les instructions système et les classifieurs de barrières de protection sont inefficaces, citant une étude de 2025 menée par OpenAI, Anthropic et Google DeepMind qui a montré que des attaques adaptatives contournent 12 défenses publiées avec un taux de réussite supérieur à 90 %. La « triple menace mortelle » de Simon Willison identifie trois ingrédients pour l'exfiltration de données : l'accès à des données privées, le contact avec du contenu non fiable et un canal sortant. La vulnérabilité EchoLeak (CVE-2025-32711) dans Microsoft 365 Copilot exploitait ces trois éléments. La « Règle du deux pour les agents » de Meta stipule qu'un agent ne doit posséder au maximum deux des trois propriétés suivantes : traiter des entrées non fiables, avoir accès à des données ou systèmes sensibles, et être capable de modifier l'état ou de communiquer vers l'extérieur. Des architectures comme Dual-LLM (Willison, 2023) séparent un LLM privilégié (avec outils, ne voyant que des entrées fiables) d'un LLM en quarantaine (sans outils, traitant le texte non fiable), reliés par un contrôleur déterministe. Le CaMeL de Google DeepMind (2024) utilise un vérificateur pour garantir que le modèle en quarantaine ne produit qu'un sous-ensemble strict de jetons autorisés. Six patrons de projet issus d'un article de 2025 étendent cette idée. Une implémentation concrète est décrite, utilisant trois modèles isolés pour un générateur de FAQ : un privilégié avec accès aux données et outils de l'entreprise, un en quarantaine pour le texte de page non fiable, et un pour la synthèse, avec des vérifications déterministes entre eux.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches