Les modèles d'IA sujets à la 'réflexion excessive' créent une vulnérabilité de sécurité
DeepSeek
Alibaba/Qwen
OpenAI
Google/DeepMind
Des chercheurs de l'université de Zhejiang et d'Alibaba ont démontré une méthode pour provoquer délibérément une 'réflexion excessive' dans les modèles d'IA de raisonnement en les soumettant à des invites logiquement incohérentes. Cette attaque par invite évolutive peut générer des sorties jusqu'à 26 fois plus longues, agissant efficacement comme une attaque par déni de service sur les services commerciaux d'IA.
Les grands modèles de langage (LLM) qui utilisent un raisonnement étape par étape sont vulnérables à un phénomène appelé « surréflexion », où ils produisent des chaînes de raisonnement excessivement longues. Des chercheurs de l'Université du Zhejiang et d'Alibaba ont développé un algorithme évolutionnaire qui corrompt la structure logique des prompts, amenant les modèles à s'engager dans des boucles de raisonnement infructueuses. L'attaque a été efficace contre les modèles de DeepSeek (R1), Alibaba (Qwen3-Thinking), OpenAI (GPT-o3) et Google (Gemini 2.5 Flash), générant des sorties jusqu'à 26,1 fois plus longues sur un benchmark mathématique. L'approche ne nécessite pas d'accès interne aux modèles et peut être transférée entre modèles, ce qui augmente sa faisabilité. Cependant, les chercheurs soulignent que leur objectif est de mettre en évidence la vulnérabilité, et non de développer une attaque pratique, et ils espèrent que les fournisseurs développeront des mesures d'atténuation.
Source: IEEE Spectrum AI —
original
