Forschung 🇺🇸 28.07.2026 16:04

Kodieren Text-Embeddings Text perfekt?

Text-Embeddings, die in Retrieval Augmented Generation (RAG)-Systemen weit verbreitet sind und in Vektordatenbanken gespeichert werden, gelten als sicher für Textdaten. Neue Forschung zeigt jedoch, dass Text-Embeddings invertiert werden können, um den Originaltext mit hoher Genauigkeit wiederherzustellen, was ernsthafte Bedenken hinsichtlich Privatsphäre und Sicherheit aufwirft.
Der Artikel beleuchtet den Aufstieg von Vektordatenbanken für RAG-Systeme, die Embeddings zur Repräsentation von Dokumenten nutzen. Embeddings sind Vektorrepräsentationen aus neuronalen Netzen und erscheinen als zufällige Zahlen, was viele dazu veranlasst, sie als sicher zu betrachten. Jedoch zeigt das Paper 'Text Embeddings Reveal As Much as Text' (EMNLP 2023), dass Text aus Embeddings wiederhergestellt werden kann. Die Forscher entwickelten vec2text, eine iterative Optimierungsmethode, die nach 50 Schritten 92 % der 32-Token-Sequenzen exakt wiederherstellt und einen BLEU-Score von 97 erreicht. Dies beweist, dass Embeddings nahezu alle Informationen des Eingabetextes enthalten, was der Annahme von Sicherheit widerspricht. Der Artikel merkt auch an, dass ähnliche Inversion in der Computervision möglich ist, und wirft Fragen zur Abwehr solcher Angriffe sowie zum Verhältnis zwischen Textlänge und Embedding-Größe auf.
Quelle: The Gradient — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten