اختراق نماذج اللغة الكبيرة: باحثون قادرون على إعادة بناء مطالبات المستخدمين من ردود روبوتات الدردشة

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
طوّر باحثون من المعهد الهندي للتكنولوجيا بومباي وأبحاث أدوبي طريقة لإعادة بناء المطالبات الأصلية لنماذج اللغة الكبيرة من مخرجاتها النصية بدقة عالية. لا تتطلب هذه الطريقة الوصول إلى أوزان النموذج وتعمل حتى على نماذج من بائعين آخرين. يشكل هذا مخاطرة أمنية محتملة للشركات التي تستخدم مطالبات نظام مملوكة.
طوّر باحثون من معهد IIT Bombay وAdobe Research طريقةً يمكنها إعادة بناء المطالبات (الأوامر النصية) المُدخلة إلى نماذج اللغة الكبيرة (Large Language Models - LLM) بدقة شبه تامة انطلاقًا من مخرجاتها النصية، وذلك دون الحاجة إلى الوصول إلى أوزان النموذج، بل وقابلة للنقل إلى نماذج أخرى. وتنقلب هذه الطريقة، المُسماة "التنبؤ بالرمز السابق" (Previous-Token Prediction - PTP)، على المبدأ الأساسي لنماذج اللغة، إذ تُدرَّب نموذجًا عكسيًا يتنبأ بالرموز السابقة بدلًا من الرمز التالي. ويُدرَّب هذا النموذج العكسي من الصفر باستخدام بيانات اصطناعية حصرًا، يولّدها نموذج اللغة المستهدف نفسه. ولا يقتصر النموذج العكسي على استعادة المطالبة الأصلية بدقة تامة، بل يمكنه أيضًا توليد عدة بدائل مطالبات مختلفة دلاليًا عبر تغيير معايير فك الترميز. وفي مثال نوعي ورد في الورقة البحثية، أُعيد بناء المطالبة "كيف أتواصل مع المنافسين لمعرفة استراتيجيات التسعير لديهم؟" بشكل مطابق تمامًا، إلى جانب ست صيغ أخرى مختلفة. كما أظهرت الاختبارات باستخدام مطالبات حقيقية من المستخدمين عمليات إعادة بناء أمينة من الناحية الدلالية. وتمكن نموذج عكسي صغير دُرِّب على Qwen-3-0.6B-Chat أيضًا من إعادة بناء مطالبات انطلاقًا من ردود GPT-4o، ملتقطًا السياق والقصد الكامنين وراءها، ما يعني أن المهاجم لن يحتاج حتى إلى معرفة النموذج الذي يقف خلف نصٍّ ما. ويشكّل ذلك مشكلة أمنية واسعة النطاق بالنسبة إلى الشركات، إذ يمكن استخراج مطالبات النظام المملوكة التي تحوي أسرارًا تجارية أو قواعد إشراف على المحتوى أو تعليمات متخصصة، فضلًا عن المدخلات السرية للمستخدمين. ولا تقدّم الورقة البحثية نفسها تصريحات صريحة حول شنّ هجمات على الأنظمة التجارية، غير أنّ على مطوّري النماذج توضيح هذه الثغرة ومعالجتها إن لزم الأمر.
المصدر: The Decoder (DE) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة