هل تقوم تضمينات النص بتشفير النص بشكل مثالي؟
تُستخدم تضمينات النص على نطاق واسع في أنظمة التوليد المعزز بالاسترجاع (Retrieval Augmented Generation - RAG) وتُخزَّن في قواعد بيانات المتجهات، ويُعتقد أنها تؤمن بيانات النص. ومع ذلك، يُظهر بحث جديد أنه يمكن عكس تضمينات النص لاستعادة النص الأصلي بدقة عالية، مما يثير مخاوف جدية تتعلق بالخصوصية والأمان.
تناقش المقالة ظهور قواعد بيانات المتجهات (vector databases) لأنظمة RAG، والتي تستخدم التضمينات (embeddings) لتمثيل المستندات. التضمينات هي تمثيلات متجهة من الشبكات العصبية، وتظهر كأرقام عشوائية، مما يدفع الكثيرين لاعتبارها آمنة. ومع ذلك، تثبت ورقة "Text Embeddings Reveal As Much as Text" (EMNLP 2023) أنه يمكن استعادة النص من التضمينات. طوّر الباحثون طريقة vec2text، وهي طريقة تحسين تكرارية، وبعد 50 خطوة تستعيد 92% من تسلسلات 32 رمزًا بدقة وتُحقق درجة BLEU تبلغ 97. وهذا يثبت أن التضمينات تحتفظ بكل المعلومات تقريبًا من النص المُدخل، مما يناقض افتراضات الأمان. تشير المقالة أيضًا إلى أن انعكاسًا مماثلاً ممكن في الرؤية الحاسوبية وتثير تساؤلات حول الدفاع ضد مثل هذه الهجمات والعلاقة بين طول النص وحجم التضمين.
المصدر: The Gradient —
الأصلي
