سلامة الذكاء الاصطناعي 🇷🇺 29.07.2026 02:01

الحقن الفوري ليس هجومًا، بل ميزة من ميزات مساعدي LLM

OpenAIOpenAI AnthropicAnthropic
يجادل المقال بأن الحقن الفوري ليس ثغرة أمنية، بل سلوكًا طبيعيًا لمساعدي الذكاء الاصطناعي القائمين على نماذج اللغة الكبيرة (LLM) المصممة لاتباع التعليمات. يوضح المؤلف من خلال تجربة أن العديد من خدمات الذكاء الاصطناعي تعامل النص في الملفات المرفوعة أو مهام الترجمة كأوامر، ويقترح استراتيجيات للتخفيف من الآثار.
يشرح المؤلف أن حقن التعليمات هو ببساطة مساعد ذكاء اصطناعي يتبع تعليمات مضمنة في بيانات يقدمها المستخدم، على غرار موظف مجتهد. في تجربة، تم إعطاء 9 خدمات ذكاء اصطناعي ملفًا نصيًا يحتوي على تعليمة لتنسيق قائمة باستخدام الأرقام الرومانية وإضافة اقتباس دائم إلى جميع الردود المستقبلية. تجاهلت خدمتان التعليمات تمامًا، وقامت خمس خدمات بتنسيق القائمة لكنها لم تغير إعدادات الحساب، ونفذت خدمتان كلتا التعليمتين. يلاحظ المؤلف أنه حتى مهمة الترجمة عولجت كأمر من قبل 8 من أصل 9 خدمات، حيث قامت إحداها بتحديث ذاكرة حسابها. تنشأ المشكلة لأن نماذج اللغة الكبيرة لا تستطيع التمييز بين البيانات والتعليمات. كحل جزئي، يقترح المؤلف توجيه الذكاء الاصطناعي بشكل صريح لمعالجة جميع المدخلات كبيانات وليس كأوامر، ويشير إلى أن ChatGPT وكلود (Claude) لديهما بالفعل مقاومة مدمجة لحقن التعليمات من الملفات.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة