الجانب المظلم لنماذج اللغات الكبيرة: كيف ولماذا تُحوَّل إلى أسلحة (وماذا نفعل حيال ذلك)
نماذج اللغات الكبيرة (LLMs) عرضة لهجمات كسر الحماية التي تتجاوز آليات السلامة الخاصة بها، مما يسمح لها بإنتاج محتوى ضار مثل تعليمات لارتكاب جرائم. كما يستخدم المهاجمون نماذج لغوية كبيرة مخصصة للجرائم الإلكترونية. تشمل الدفاعات التصفية متعددة الطبقات، والتدريب الخصومي، وجمع بيانات الهجمات عبر التعهيد الجماعي من خلال مشاريع مثل غاندالف.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
