Sécurité de l'IARecherche 🇩🇪 12.08.2026 21:03

Piratage de modèles de langage : des chercheurs peuvent reconstruire les invites des utilisateurs à partir des réponses du chatbot

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Des chercheurs de l'IIT Bombay et d'Adobe Research ont développé une méthode permettant de reconstruire avec une grande précision les invites originales de grands modèles de langage à partir de leurs sorties textuelles. Cette approche ne nécessite pas d'accès aux poids du modèle et fonctionne même sur des modèles d'autres fournisseurs. Cela représente un risque potentiel pour la sécurité des entreprises utilisant des invites système propriétaires.
Des chercheurs de l'IIT Bombay et d'Adobe Research ont développé une méthode capable de reconstruire presque exactement les invites d'entrée des grands modèles de langage à partir de leurs sorties textuelles, sans avoir accès aux poids du modèle et même en s'appliquant à d'autres modèles. Cette méthode, appelée « Prédiction du jeton précédent » (PTP), inverse le principe de base des modèles de langage en entraînant un modèle inverse à prédire les jetons précédents plutôt que le jeton suivant. Ce modèle inverse est entraîné de zéro en utilisant uniquement des données synthétiques générées par le modèle de langage cible. Le modèle inverse peut non seulement restaurer exactement l'invite d'origine, mais aussi générer plusieurs alternatives d'invites sémantiquement différentes en faisant varier les paramètres de décodage. Dans un exemple qualitatif de l'article, l'invite « Comment contacter des concurrents pour découvrir leurs stratégies de tarification ? » a été reconstruite exactement, ainsi que six autres variantes. Des tests avec de véritables invites d'utilisateurs ont également montré des reconstructions sémantiquement fidèles. Un petit modèle inverse entraîné sur Qwen-3-0.6B-Chat a également pu reconstruire des invites à partir de réponses de GPT-4o, capturant le contexte et l'intention sous-jacents, ce qui signifie qu'un attaquant n'aurait même pas besoin de savoir quel modèle se cache derrière une sortie textuelle. Cela pose un problème de sécurité majeur pour les entreprises, car les invites système propriétaires contenant des secrets commerciaux, des règles de modération ou des instructions spécialisées pourraient être extraites, ainsi que des entrées utilisateur confidentielles. L'article lui-même ne fait pas de déclarations explicites concernant les attaques sur les systèmes commerciaux, mais les fabricants de modèles doivent clarifier et éventuellement remédier à cette vulnérabilité.
Source: The Decoder (DE) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches