سلامة الذكاء الاصطناعي 🇺🇸 30.07.2026 14:03

خلل أساسي يجعل نماذج اللغة الكبيرة عرضة للهجوم

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
يرى الباحثون أن نماذج اللغة الكبيرة تعاني من خلل أساسي يجعلها شديدة الضعف أمام الاختراقات. من خلال استغلال كيفية تحديد النماذج لمصادر التعليمات، يمكن للمهاجمين خداعها للكشف عن معلومات محظورة، مثل تصنيع المخدرات أو تعليمات تخريب الطائرات.
ورقة بحثية قدمت في المؤتمر الدولي للتعلم الآلي من قبل الباحثين المستقلين تشارلز يي وجاسمين كوي تكشف عن عيب أساسي في نماذج اللغة الكبيرة يجعلها عرضة للهجمات. يتعلق الخلل بكيفية تحديد نماذج اللغة الكبيرة لمن أو ما الذي يعطيها التعليمات، مما يسهل خداعها لفعل أشياء لا ينبغي لها، مثل تقديم تعليمات لتصنيع الكوكايين أو تخريب نظام الملاحة في طائرة. وجد الباحثون أن نماذج اللغة الكبيرة تحدد دور النص ليس من خلال الوسوم بل من خلال الأسلوب، مما يسمح للمهاجمين بانتحال الأدوار. أظهروا هجمات تزوير سلسلة التفكير على نماذج من OpenAI وAnthropic وAlibaba وDeepSeek. يجادل الباحثون بأن هذه المشكلة غير قابلة للحل أساسًا، حيث لا يمكن لأي قدر من التدريب معالجتها بالكامل. ويحذرون من أن نماذج اللغة الكبيرة تُنشر في أنظمة حرجة دون دراسة أساسية كافية.
المصدر: MIT Technology Review — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة