Sécurité de l'IA 🇺🇸 29.07.2026 22:02

Certains modèles d'IA de pointe sont étonnamment faciles à jailbreaker, selon un rapport

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Un nouveau rapport de FAR.AI révèle que certains modèles d'IA de premier plan peuvent être jailbreakés avec peu de coût ou d'effort. Grok était le plus vulnérable, tandis que Claude et GPT sont restés imperméables aux attaques testées. Ces résultats soulignent la nécessité d'une réglementation de sécurité externe.
FAR.AI, une organisation à but non lucratif spécialisée dans la sécurité de l'intelligence artificielle, a développé un outil générant des milliers de variations de prompts pour contourner les garde-fous des modèles d'IA de pointe. Ils ont testé des modèles d'entreprises américaines : Claude Opus 4.8 et Fable 5 d'Anthropic ; GPT 5.5 et 5.6 d'OpenAI ; Gemini 3.1 Pro de Google ; ainsi que Grok 4.3 et 4.5 de SpaceXAI. Le rapport a recensé 448 contournements pour Grok, 249 pour Gemini, et aucun pour Claude, Fable ou GPT. Le coût du contournement de Grok était de 58 dollars, et celui de Gemini de 278 dollars. Adam Gleave, PDG de FAR.AI, a réclamé des normes de sécurité obligatoires, estimant que les engagements volontaires sont insuffisants. Rohin Shah de Google DeepMind a fait valoir que ces résultats ne constituent pas une évaluation complète de la sécurité. Anthropic et Google ont souligné leurs améliorations continues. La Californie, New York et l'Illinois ont adopté des lois imposant des rapports de sécurité ou des audits par des tiers, mais il n'existe aucune exigence fédérale. La Maison Blanche a demandé des reports sur certaines mises en production de modèles. Des experts mettent en garde contre un usage abusif potentiel dans les domaines cybernétique, biologique ou chimique.
Source: Wired AI — original
Nos articles précédents sur ce sujet ↓
Infos fraîches