L’injection de prompt ne se guérit pas par des filtres : comment isoler le texte non fiable avec des motifs architecturaux
L’injection de prompt est un défaut structurel des grands modèles de langage où un texte non fiable est exécuté comme une instruction. Les filtres et les prompts système sont inefficaces : même les meilleures défenses sont contournées dans 90 % des cas lors d’attaques adaptatives. Les approches qui fonctionnent — Dual-LLM, CaMeL et la règle des Two Meta — construisent un isolement plutôt que d’essayer de distinguer le bien du mal.
OpenAI
Anthropic
Google DeepMind
Microsoft
Habr — хаб ИИ24.07 · 11:01
