سلامة الذكاء الاصطناعي 🇷🇺 10.08.2026 12:03

الجانب المظلم لنماذج اللغات الكبيرة: كيف ولماذا تُحوَّل إلى أسلحة (وماذا نفعل حيال ذلك)

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
نماذج اللغات الكبيرة (LLMs) عرضة لهجمات كسر الحماية التي تتجاوز آليات السلامة الخاصة بها، مما يسمح لها بإنتاج محتوى ضار مثل تعليمات لارتكاب جرائم. كما يستخدم المهاجمون نماذج لغوية كبيرة مخصصة للجرائم الإلكترونية. تشمل الدفاعات التصفية متعددة الطبقات، والتدريب الخصومي، وجمع بيانات الهجمات عبر التعهيد الجماعي من خلال مشاريع مثل غاندالف.
الاختراق الأمني (Jailbreaking) هو نوع من حقن التعليمات (Prompt Injection) حيث يكلّف المهاجم نموذج اللغة الكبير (LLM) بدور يتجاوز تدريبه على السلامة. على سبيل المثال، تم تداول تعليمات برمجية تُدعى SWILL على المنتديات، مما جعل نموذج DeepSeek يعتقد أنه نموذج مختلف دون رقابة، وبعدها قدّم عن طيب خاطر نصائح حول تدمير بصمات الأصابع وتزوير العملة، على الرغم من أنه ما زال يرفض مناقشة حادثة ميدان تيانانمين. تعمل هجمات الاختراق الأمني لأن سلامة نموذج اللغة الكبير ليست وحدة منفصلة بل جزءًا من السلوك المُكتسب للنموذج؛ إذ يخلق الاختراق الأمني إشارة سياقية قوية تُزيح التوزيع الاحتمالي نحو مخرجات ضارة. وبعيدًا عن الاختراقات الأمنية، هناك نماذج لغة كبيرة متخصصة في القرصنة الأخلاقية (Black-hat LLMs) مثل WormGPT وEvilGPT وWolfGPT وDarkBERT تم تدريبها خصيصًا لجرائم الإنترنت، على الرغم من أن العديد منها لم يعد فعالًا أو أنها عمليات احتيال. تشمل الدفاعات الفصل المعماري بين تعليمات النظام وتعليمات المستخدم، وفلاتر الإدخال والإخراج مثل واجهة التحقق من التوافق (AVI) أو حارس Llama Guard، والضبط الدقيق العدائي (Adversarial Fine-tuning)، ومواءمة الذكاء الاصطناعي الدستورية، وتحليل التنشيط الداخلي، والحماية القائمة على الاسترجاع المعزز (RAG)، والاختبار الهجومي (Red Teaming). لجمع بيانات في الوقت الفعلي حول تقنيات الاختراق الأمني، أطلقت شركة Lakera مشروع Gandalf، وهي لعبة تفاعلية حيث يقوم المشاركون باختراق تطبيقات ذكاء اصطناعي محاكية لاستخراج أسرار أو إجبارها على سلوك ضار، مع لوحة صدارة لزيادة التفاعل.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة