Coderen tekstembeddings tekst perfect?
Tekstembeddings, veel gebruikt in Retrieval Augmented Generation (RAG)-systemen en opgeslagen in vectordatabases, worden verondersteld tekstgegevens te beveiligen. Nieuw onderzoek toont echter aan dat tekstembeddings kunnen worden geïnverteerd om de oorspronkelijke tekst met hoge nauwkeurigheid te herstellen, wat ernstige privacy- en veiligheidsproblemen oplevert.
Het artikel bespreekt de opkomst van vectordatabases voor RAG-systemen, die embeddings gebruiken om documenten te representeren. Embeddings zijn vectorrepresentaties van neurale netwerken en ze zien eruit als willekeurige getallen, waardoor velen ze als veilig beschouwen. Echter, het artikel 'Text Embeddings Reveal As Much as Text' (EMNLP 2023) toont aan dat tekst kan worden teruggewonnen uit embeddings. De onderzoekers ontwikkelden vec2text, een iteratieve optimalisatiemethode die na 50 stappen 92% van de 32-token-reeksen exact terugvindt en een BLEU-score van 97 behaalt. Dit bewijst dat embeddings bijna alle informatie van de invoertekst behouden, wat in tegenspraak is met de aanname van veiligheid. Het artikel merkt ook op dat soortgelijke inversie mogelijk is in computervisie en roept vragen op over hoe dergelijke aanvallen kunnen worden afgeweerd en over de relatie tussen tekstlengte en embeddinggrootte.
Bron: The Gradient —
origineel
