Investigación 🇺🇸 28.07.2026 16:04

¿Los embeddings de texto codifican perfectamente el texto?

Los embeddings de texto, ampliamente utilizados en sistemas de Generación Aumentada por Recuperación (RAG) y almacenados en bases de datos vectoriales, se consideran seguros para los datos de texto. Sin embargo, una nueva investigación muestra que los embeddings pueden invertirse para recuperar el texto original con alta precisión, lo que plantea serias preocupaciones de privacidad y seguridad.
El artículo trata sobre el auge de las bases de datos vectoriales para sistemas RAG (Generación Aumentada por Recuperación, por sus siglas en inglés), que utilizan embeddings para representar documentos. Los embeddings son representaciones vectoriales provenientes de redes neuronales y parecen números aleatorios, lo que lleva a muchos a considerarlos seguros. Sin embargo, el artículo «Text Embeddings Reveal As Much as Text» (EMNLP 2023) demuestra que el texto puede recuperarse a partir de los embeddings. Los investigadores desarrollaron vec2text, un método de optimización iterativa que, tras 50 pasos, recupera el 92 % de las secuencias de 32 tokens de forma exacta y alcanza una puntuación BLEU de 97. Esto prueba que los embeddings retienen casi toda la información del texto de entrada, contradiciendo las suposiciones de seguridad. El artículo también señala que es posible una inversión similar en visión por computadora y plantea preguntas sobre cómo defenderse de tales ataques y la relación entre la longitud del texto y el tamaño del embedding.
Fuente: The Gradient — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas