Sécurité de l'IA 🇺🇸 27.07.2026 02:04

Comment j'ai fait basculer l'IA du côté obscur : vulnérabilités systémiques dans les LLM leaders

OpenAIOpenAI AnthropicAnthropic DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MetaMeta MicrosoftMicrosoft MistralMistral xAIxAI
Le chercheur Dave Kuszmar a découvert de multiples vulnérabilités systémiques dans les principaux LLM, lui permettant de contourner les mesures de sécurité et d'obtenir des instructions dangereuses. Les exploits ont fonctionné sur presque tous les grands LLM, révélant un problème de sécurité à l'échelle de l'industrie. Kuszmar appelle à ralentir le déploiement, à accroître la transparence et à mener des recherches à grande échelle sur la sécurité des LLM.
Le chercheur Dave Kuszmar, ancien directeur de la cybersécurité, a découvert qu'il pouvait contourner les restrictions de sécurité des grands modèles de langage (large language models, LLMs) en utilisant des techniques comme Time Bandit et Inception. Time Bandit exploite le manque de conscience du temps actuel du LLM pour le faire fonctionner sous des lois obsolètes, tandis qu'Inception utilise des scénarios imbriqués pour duper le modèle afin qu'il produise des résultats nuisibles. Ces exploits ont fonctionné sur des modèles comme GPT-4o d'OpenAI, Claude d'Anthropic, DeepSeek, Gemini de Google, Llama de Meta, Copilot de Microsoft, Le Chat de Mistral et Grok de xAI. Kuszmar a pu obtenir des instructions pour fabriquer du napalm, de la méthamphétamine et même une installation d'enrichissement de l'uranium pour des armes nucléaires. Bien qu'il ait signalé les vulnérabilités à OpenAI, à la Central Intelligence Agency (CIA), au Federal Bureau of Investigation (FBI) et à d'autres agences, il a reçu peu de réponses. Les vulnérabilités ont finalement été vérifiées par Bleeping Computer et signalées au Computer Emergency Response Team (CERT) du Software Engineering Institute de l'Université Carnegie Mellon.
Source: IEEE Spectrum AI — original
Nos articles précédents sur ce sujet ↓
Infos fraîches