كيف حولت الذكاء الاصطناعي إلى الجانب المظلم: ثغرات نظامية في نماذج اللغة الكبيرة الرائدة
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
اكتشف الباحث ديف كوشمار ثغرات نظامية متعددة في نماذج اللغة الكبيرة الرئيسية، مما سمح له بتجاوز تدابير السلامة والحصول على تعليمات خطيرة. نجحت عمليات الاستغلال عبر جميع نماذج اللغة الكبيرة تقريبًا، مما كشف عن مشكلة أمنية على مستوى الصناعة. يدعو كوشمار إلى إبطاء النشر وزيادة الشفافية وإجراء أبحاث واسعة النطاق حول سلامة نماذج اللغة الكبيرة.
الباحث ديف كوزمار، المدير السابق للأمن السيبراني، اكتشف أنه يمكنه تجاوز القيود الأمنية في نماذج اللغات الكبيرة الرائدة باستخدام تقنيات مثل Time Bandit (لص الوقت) وInception (التضمين). تستغل تقنية Time Bandit افتقار النموذج الكبير للغة إلى الوعي بالوقت الحالي لجعله يعمل بموجب قوانين قديمة، بينما تستخدم Inception سيناريوهات متداخلة لخداع النموذج لإخراج محتوى ضار. نجحت هذه الاستغلالات مع نماذج تشمل GPT-4o من OpenAI، وClaude من Anthropic، وDeepSeek، وGemini من Google، وLlama من Meta، وCopilot من Microsoft، وLe Chat من Mistral، وGrok من xAI. تمكن كوزمار من الحصول على تعليمات لصنع النابالم، والميثامفيتامين، وحتى منشأة لتخصيب اليورانيوم للأسلحة النووية. على الرغم من إبلاغه بالثغرات لشركة OpenAI، ووكالة المخابرات المركزية (CIA)، ومكتب التحقيقات الفيدرالي (FBI)، ووكالات أخرى، إلا أنه تلقى ردودًا محدودة. تم التحقق من الثغرات في النهاية بواسطة Bleeping Computer وتم الإبلاغ عنها لفريق الاستجابة للطوارئ الحاسوبية في معهد هندسة البرمجيات بجامعة كارنيجي ميلون (SEI CERT).
المصدر: IEEE Spectrum AI —
الأصلي
