حقن الأوامر لا يمكن علاجه بواسطة المرشحات: كيفية عزل النص غير الموثوق باستخدام الأنماط المعمارية

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
حقن الأوامر هو عيب هيكلي في نماذج اللغة الكبيرة حيث يتم تنفيذ النص غير الموثوق كتعليمات. المرشحات وأوامر النظام غير فعالة: حتى أفضل الدفاعات يتم اختراقها في 90٪ من الحالات تحت الهجمات التكيفية. الأساليب العاملة - Dual-LLM و CaMeL وقاعدة Two Meta - تبني العزل بدلاً من محاولة التمييز بين الخير والشر.
يعتبر حقن التعليمات (Prompt injection) ثغرة أمنية يتم فيها إدخال نص غير موثوق (مثل نص من صفحة ويب أو بريد إلكتروني) في سياق نموذج اللغة الكبير (LLM) ليتم تنفيذه كتعليمات، مما يؤدي إلى سرقة البيانات أو إجراءات غير مصرح بها. لا يُعد هذا هجومًا لاختراق الحماية (jailbreak): المهاجم شخص آخر، والضحية هي المستخدم الذي طلب ببساطة معالجة المحتوى. لا تعمل وسائل الحماية التقليدية — مثل التعليمات النظامية "تجاهل تعليمات الآخرين" والمصنفات عند الإدخال — بسبب التنوع اللامتناهي للهجمات وعدم القدرة على التنبؤ بالنماذج. أظهرت دراسة "المهاجم يتحرك ثانيًا" (The Attacker Moves Second, 2025) أن 12 من وسائل الحماية المنشورة تم اختراقها في أكثر من 90% من الحالات عند الهجمات التكيفية؛ وجلسة فريق أحمر حية اخترقت جميعها بنسبة 100%. تُعزى الثغرة إلى "الثلاثي القاتل": بيانات خاصة + محتوى غير موثوق + قناة للخارج. مثال على ذلك ثغرة EchoLeak (CVE-2025-32711) ضد Microsoft 365 Copilot: استغلال بدون نقرة عبر بريد إلكتروني تجاوز المصنفات ومرشحات الروابط وسياسة أمان المحتوى (CSP) وتوليد الاسترجاع المعزز (RAG). اقترحت Meta "قاعدة الاثنين": يجب ألا يكون للوكيل إمكانية الوصول في نفس الوقت إلى البيانات ومعالجة المدخلات غير الموثوقة وتغيير الحالة أو التواصل مع العالم الخارجي. يقوم نمط النظام ثنائي النموذج (Dual-LLM) بفصل الوظائف على نموذجين: النموذج المميز (المزود بالأدوات) لا يرى النص غير الموثوق، والنموذج المعزول (الذي يتعامل مع النص) لا يملك أدوات؛ ويرسل رمز المتحكم فقط متغيرات رمزية. اقترحت Google DeepMind نظام CaMeL (Confidential Multi-Agent LLM) — وهو نظام تشفير على مستوى التحكم في الوصول القائم على الأدوار (RBAC)، حيث يُمنح كل وكيل الأدوار الضرورية فقط، ويتم وضع علامات على البيانات غير الموثوقة بحيث لا يراها الوكلاء المميزون. في عام 2025، تم نشر ستة أنماط تصميمية تنظم العزل حسب المهمة. تم شرح تنفيذ عملي على ثلاثة نماذج لا ترى بعضها البعض مع فحوصات حتمية، باستخدام مثال مولد الأسئلة الشائعة (FAQ) الذي يقرأ صفحة خارجية ولكنه لا يطيعها.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة