Sécurité de l'IA 🇺🇸 30.07.2026 14:03

Une faille fondamentale rend les LLM vulnérables aux attaques

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Des chercheurs affirment que les grands modèles de langage présentent une faille fondamentale qui les rend très vulnérables aux piratages. En exploitant la manière dont les LLM identifient les sources d'instructions, les attaquants peuvent les amener à révéler des informations interdites, comme la synthèse de drogues ou des instructions de sabotage d'avions.
Un article présenté à la Conférence internationale sur l'apprentissage automatique par les chercheurs indépendants Charles Ye et Jasmine Cui révèle une faille fondamentale dans les grands modèles de langage qui les rend vulnérables aux attaques. Cette faille concerne la manière dont les grands modèles de langage identifient qui ou quoi leur donne des instructions, ce qui permet de les tromper facilement pour leur faire faire des choses qu'ils ne devraient pas, comme fournir des instructions pour synthétiser de la cocaïne ou saboter le système de navigation d'un aéronef. Les chercheurs ont découvert que les grands modèles de langage identifient le rôle d'un texte non pas par des balises mais par le style, ce qui permet aux attaquants d'usurper des rôles. Ils ont démontré des attaques par falsification de chaîne de pensée sur des modèles d'OpenAI, d'Anthropic, d'Alibaba et de DeepSeek. Les chercheurs soutiennent que ce problème est fondamentalement insoluble, car aucune quantité d'entraînement ne peut y remédier complètement. Ils avertissent que les grands modèles de langage sont déployés dans des systèmes critiques sans étude fondamentale suffisante.
Source: MIT Technology Review — original
Nos articles précédents sur ce sujet ↓
Infos fraîches