Chiffrement contourné : comment les modèles d'IA exposent facilement les données sensibles des utilisateurs
Anthropic
OpenAI
Google/DeepMind
Des chercheurs allemands ont trouvé un moyen d'extraire des données sensibles telles que des mots de passe et des clés API des assistants conversationnels IA en exploitant les « journaux de raisonnement » chiffrés utilisés par des modèles comme ChatGPT, Claude et Gemini. L'attaque consiste à copier ces journaux et à les utiliser avec des versions plus anciennes ou modifiées des modèles de la même entreprise, brisant ainsi efficacement le chiffrement. L'équipe a déchiffré plus de 315 000 journaux, révélant 62 clés API, 33 mots de passe et d'autres informations personnelles.
Des chercheurs allemands ont publié un article intitulé « Stealing Reasoning Traces from Proprietary LLM APIs » démontrant comment les modèles d'IA d'Anthropic, OpenAI et Google peuvent fuiter des données sensibles des utilisateurs. Lorsqu'ils effectuent des tâches de raisonnement, ces modèles génèrent une chaîne chiffrée appelée « journal de raisonnement » qui est renvoyée au serveur avec chaque nouvelle réponse pour fournir un contexte. Les chercheurs ont découvert que les journaux de raisonnement peuvent être copiés et utilisés dans d'autres modèles de la même entreprise, y compris des versions plus anciennes ou modifiées. Si un modèle modifié a ses mesures de sécurité supprimées via un jailbreak, il peut décoder le chiffrement des journaux. En utilisant 6 708 dépôts publics de GitHub et Hugging Face, ils ont réussi à déchiffrer 315 320 journaux de raisonnement, qui contenaient 62 clés API, 33 mots de passe, 24 jetons d'accès, 30 adresses e-mail personnelles et les noms/adresses des mainteneurs de projets. Beaucoup de ces détails n'étaient présents que dans les journaux de raisonnement, pas ailleurs dans la session de chat. L'expert en sécurité Voldemaras Kadys de Cybernews note que le chiffrement n'a pas été cassé au sens traditionnel ; au lieu de cela, le partage de traces de raisonnement chiffrées entre des modèles compatibles permet à des modèles plus faibles de devenir une clé maîtresse pour le déchiffrement. Il conseille de traiter les journaux de raisonnement comme des données sensibles et de ne jamais les partager.
Source: t3n —
original
