Le côté obscur des grands modèles de langage : comment et pourquoi ils sont transformés en armes (et que faire à ce sujet)
Les grands modèles de langage (Large Language Models, ou LLM) sont vulnérables aux attaques par jailbreak qui contournent leurs mécanismes de sécurité, leur permettant de produire des contenus nuisibles, tels que des instructions pour commettre des crimes. Les acteurs malveillants utilisent également des LLM black-hat dédiés à la cybercriminalité. Les défenses incluent le filtrage en couches, l'entraînement contradictoire et la collecte de données d'attaques participatives via des projets comme Gandalf.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
