StruQ و SecAlign: الدفاع ضد هجمات حقن المطالبات

MetaMeta OpenAIOpenAI
يقترح باحثون من مختبر أبحاث الذكاء الاصطناعي في بيركلي (BAIR) أسلوبي ضبط دقيق، StruQ و SecAlign، ضد هجمات حقن المطالبات في التطبيقات المدمجة مع نماذج اللغات الكبيرة. يستخدم StruQ ضبط التعليمات المهيكلة لتجاهل التعليمات المحقونة، بينما يطبق SecAlign تحسين التفضيلات لتحقيق متانة أفضل، مما يقلل معدلات نجاح الهجوم إلى ما يقرب من 0% للهجمات الخالية من التحسين وأقل من 15% للهجمات القائمة على التحسين.
يعتبر حقن المطالبات (Prompt injection) من أكبر التهديدات وفقًا لتصنيف OWASP للتطبيقات المدمجة مع نماذج اللغة الضخمة (LLM)، وذلك عندما تحتوي البيانات غير الموثوقة على تعليمات تتجاوز المطالبة النظامية المقصودة. وقد ثبت تعرض أنظمة إنتاجية مثل Google Docs وSlack AI وChatGPT لهذا النوع من الهجمات. يقترح المؤلفون سببين لهذه المشكلة: الافتقار إلى الفصل بين المطالبة والبيانات، وتدريب نماذج اللغة الضخمة (LLMs) على اتباع التعليمات في أي مكان ضمن المدخلات. ولمعالجة هذه المشكلة، يقدم الباحثون واجهة أمامية آمنة (Secure Front-End) تستخدم رموزًا خاصة لفصل المطالبة عن البيانات، مع تصفية أي رموز فاصلة داخل البيانات. كما يقدمون تقنية ضبط التعليمات المنظمة (StruQ) التي تحاكي هجمات حقن المطالبات أثناء التدريب، مما يعلم النموذج تجاهل التعليمات المحقونة في جزء البيانات. وتذهب تقنية تحسين التفضيلات الخاص (SecAlign) خطوة أبعد من خلال التدريب على كل من الاستجابات المرغوبة وغير المرغوبة، باستخدام تحسين التفضيلات لإنشاء فجوة كبيرة في الاحتمالات بينهما. أظهرت التجارب على نموذج Llama3-8B-Instruct أن تقنية StruQ تقلل معدل نجاح الهجوم (ASR) إلى 45%، بينما تخفضه تقنية SecAlign إلى 8% ضد الهجمات المتطورة. وتحافظ تقنية SecAlign على الفائدة العملية كما تم قياسها بواسطة AlpacaEval2، بينما تقللها StruQ بنسبة 4.5%. وتخفض كلتا التقنيتين معدلات نجاح الهجمات الخالية من التحسين إلى 0% تقريبًا، وتخفض SecAlign معدل نجاح الهجمات القائمة على التحسين (ASR) بأكثر من 4 أضعاف مقارنة بأفضل الطرق السابقة.
المصدر: BAIR (Berkeley AI) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة