Une nouvelle méthode extrait le raisonnement caché des modèles d'IA de pointe
OpenAI
Anthropic
Google/DeepMind
Moonshot AI
DeepSeek
Alibaba/Qwen
Des chercheurs ont trouvé un moyen d'extraire le raisonnement caché des modèles d'IA de pointe, ce qui pourrait permettre des attaques par distillation et révéler des informations privées. Ils ont identifié ce problème dans les modèles d'OpenAI, d'Anthropic et de Google, et ont découvert que le modèle chinois Kimi K3 produit un raisonnement étonnamment similaire à celui de Claude Opus et de GPT-5.6, bien que cela ne constitue pas une preuve concluante de distillation. Les entreprises ont atténué la vulnérabilité sans toutefois la corriger entièrement.
Des informaticiens, dont Alexander Panfilov de l'université de Tübingen, ont découvert une méthode pour extraire le « raisonnement » caché des modèles d'IA de pointe. Cette technique exploite le fait que les entreprises proposent des variantes de modèles plus petites et moins alignées qui partagent la même clé de décryptage, mais qui sont plus enclines à révéler leur raisonnement interne. En fournissant des traces de raisonnement chiffrées à ces modèles plus petits, les chercheurs ont pu découvrir le raisonnement des modèles plus grands, ce qui pourrait permettre des attaques par distillation et exposer des informations personnelles telles que des clés API et des mots de passe. Ils ont constaté que le modèle chinois Kimi K3 de Moonshot AI produisait un raisonnement étonnamment similaire à celui de Claude Opus 4.8 et de GPT-5.6 Sol, mais ont noté que cela n'établit pas de manière causale une distillation. La vulnérabilité a été signalée à OpenAI, Anthropic et Google, qui ont mis en place des mesures d'atténuation, mais Panfilov affirme que certaines traces de raisonnement peuvent encore être extraites. Cette question met en lumière l'importance géopolitique croissante de la distillation, les entreprises chinoises étant accusées de l'utiliser pour copier les modèles américains, bien que les experts soient divisés sur son impact réel.
Source: Wired AI —
original
