Les pensées de l'IA peuvent être lues en utilisant une autre IA, révélant des mots de passe et des clés
Anthropic
OpenAI
Google/DeepMind
Des chercheurs ont démontré une attaque qui déchiffre les traces de raisonnement cachées des grands modèles de langage propriétaires d'Anthropic, d'OpenAI et de Google en utilisant deux appels API, sans attaquer le modèle cible. La méthode a également révélé que les journaux publics d'agents contiennent des centaines de secrets, y compris des mots de passe et des clés, cachés dans des blocs chiffrés.
Huit chercheurs de l'ELLIS Institute Tübingen, du Max Planck Institute for Intelligent Systems, du Tübingen AI Center, de MATS et de Snyk ont publié une prépublication le 10 août décrivant une attaque sur les traces de raisonnement chiffrées de modèles d'Anthropic, d'OpenAI et de Google. L'attaque consiste à prendre le bloc chiffré d'un modèle puissant (par exemple, Claude Opus 4.8) et à le fournir à un modèle plus faible du même fournisseur (par exemple, Haiku 4.5), auquel on demande ensuite de réécrire le raisonnement mot pour mot, le déchiffrant ainsi. L'attaque ne casse pas le chiffrement ni n'attaque le modèle puissant ; elle exploite le fait que le bloc chiffré est renvoyé au client et doit être renvoyé avec la requête suivante. Les chercheurs ont vérifié l'authenticité des traces déchiffrées sur 120 tâches Codeforces. Ils ont également analysé 6708 journaux d'agents publics provenant de GitHub et de Hugging Face, récupérant 315 320 blocs de raisonnement, qui contenaient 704 secrets uniques, dont 62 clés API, 33 mots de passe, 24 jetons d'accès, ainsi que des adresses électroniques, des noms et des URL internes. Notamment, 64 de ces secrets n'étaient visibles nulle part dans la session visible, n'existant qu'à l'intérieur des blocs chiffrés. L'article décrit également un vecteur d'empoisonnement où un bloc malveillant peut être implanté pour injecter des instructions dans un agent qui le charge ultérieurement. Les auteurs proposent des mesures cryptographiques et système pour lier le bloc à la session, à l'utilisateur et au modèle, mais pour l'instant, les utilisateurs doivent traiter les blocs de raisonnement chiffrés comme des secrets et éviter de partager des journaux publiquement.
Source: Habr — хаб ИИ —
original
