Les plongements de texte encodent-ils parfaitement le texte ?
Les plongements de texte, largement utilisés dans les systèmes de génération augmentée par récupération (RAG) et stockés dans des bases vectorielles, sont censés sécuriser les données textuelles. Cependant, de nouvelles recherches montrent que les plongements de texte peuvent être inversés pour retrouver le texte original avec une grande précision, soulevant de sérieuses préoccupations en matière de confidentialité et de sécurité.
L'article traite de l'essor des bases de données vectorielles pour les systèmes RAG, qui utilisent des embeddings pour représenter des documents. Les embeddings sont des représentations vectorielles issues de réseaux de neurones, et ils apparaissent comme des nombres aléatoires, ce qui amène beaucoup à les considérer comme sécurisés. Cependant, l'article « Text Embeddings Reveal As Much as Text » (EMNLP 2023) démontre qu'il est possible de retrouver le texte à partir des embeddings. Les chercheurs ont développé vec2text, une méthode d'optimisation itérative qui, après 50 étapes, retrouve exactement 92 % des séquences de 32 tokens et obtient un score BLEU de 97. Cela prouve que les embeddings conservent presque toutes les informations du texte d'entrée, contredisant les hypothèses de sécurité. L'article note également qu'une inversion similaire est possible en vision par ordinateur et soulève des questions sur la défense contre de telles attaques ainsi que sur la relation entre la longueur du texte et la taille des embeddings.
Source: The Gradient —
original
