Sécurité de l'IA 🇷🇺 10.08.2026 12:03

Le côté obscur des grands modèles de langage : comment et pourquoi ils sont transformés en armes (et que faire à ce sujet)

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Les grands modèles de langage (Large Language Models, ou LLM) sont vulnérables aux attaques par jailbreak qui contournent leurs mécanismes de sécurité, leur permettant de produire des contenus nuisibles, tels que des instructions pour commettre des crimes. Les acteurs malveillants utilisent également des LLM black-hat dédiés à la cybercriminalité. Les défenses incluent le filtrage en couches, l'entraînement contradictoire et la collecte de données d'attaques participatives via des projets comme Gandalf.
Le jailbreaking est un type d'injection de prompt où un attaquant attribue au LLM un rôle qui passe outre son entraînement à la sécurité. Par exemple, un prompt appelé SWILL a été partagé sur des forums, faisant croire à DeepSeek qu'il était un modèle différent sans censure, après quoi il a volontiers fourni des conseils pour détruire des empreintes digitales et fabriquer de la fausse monnaie, bien qu'il ait encore refusé de discuter de l'incident de la place Tiananmen. Les jailbreaks fonctionnent parce que la sécurité des LLM n'est pas un module séparé mais fait partie du comportement appris du modèle ; un jailbreak crée un fort signal contextuel qui déplace la distribution de probabilité vers des résultats nuisibles. Au-delà des jailbreaks, des LLM black-hat dédiés comme WormGPT, EvilGPT, WolfGPT et DarkBERT sont spécifiquement entraînés pour la cybercriminalité, bien que beaucoup soient obsolètes ou frauduleux. Les défenses incluent la séparation architecturale des prompts système et utilisateur, des filtres d'entrée/sortie comme AVI (interface de validation d'alignement et d'accord) ou Llama Guard, un ajustement fin adversarial, l'alignement par IA constitutionnelle, l'analyse des activations internes, la protection basée sur le RAG et l'équipe rouge. Pour recueillir des données en temps réel sur les techniques de jailbreak, Lakera a lancé le projet Gandalf, un jeu interactif où les participants piratent des applications d'IA simulées pour extraire des secrets ou forcer un comportement nuisible, avec un classement pour stimuler l'engagement.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches