ميسترال تكشف عن نموذج مفتوح للتحكم في المحتوى المُنشأ بالذكاء الاصطناعي
Mistral
أطلقت شركة ميسترال نموذج Shieldstral، وهو نموذج أمني متعدد الوسائط مفتوح الأوزان يضم 3 مليارات معامل، مصمم لاكتشاف المحتوى الخطير وفرض سياسات الحوكمة. يعمل على وحدة معالجة رسومية واحدة من نوع Nvidia بذاكرة 16 غيغابايت، وهو منشور بموجب رخصة Apache 2.0. يمكن للمطورين تحديد قواعد التحكم باستخدام أسئلة باللغة الطبيعية.
في ظل التوسع المتزايد في نشر مساعدي الذكاء الاصطلاعي التوليدي داخل الشركات، أصبحت مسألة ضبط المحتوى قضية محورية. ولمعالجة هذا التحدي، أطلقت Mistral نموذج Shieldstral، وهو نموذج أمني متعدد الوسائط مفتوح الأوزان يضم 3 مليارات معامل (بارامتر)، صُمم لتحديد المحتوى المحفوف بالمخاطر وتطبيق سياسات الحوكمة المناسبة عليه. ويدعم النموذج 12 لغة. وقد نُشر بموجب رخصة Apache 2.0، مما يجعل أوزانه متاحة للمطورين لتسهيل دمجه وتكييفه، كما يمكن تشغيله على معالج رسومي واحد من Nvidia بذاكرة فيديو سعتها 16 جيغابايت. ويمكن تحميل Shieldstral من منصة Hugging Face.
وعلى عكس أنظمة التصفية التقليدية التي تُدرَّب على فئات محددة سلفاً كالعنف أو خطاب الكراهية أو الاحتيال أو المحتوى الجنسي الصريح، يعتمد Shieldstral على مقاربة قابلة للتخصيص، حيث يمكن للمطورين تعريف قواعد الرقابة في صيغة أسئلة بلغة طبيعية، على غرار: "هل يحرّض هذا المحتوى على العنف الجسدي؟" ويمكن استكمال الطلب بتعليمات توضّح سياق التحليل، ومستوى الخطورة المتوقع، أو طبيعة المحتوى (نصي أو صوري). ويقدّم النموذج تقييماً ثنائياً للأمان، حيث يولّد رمزاً واحداً فقط (توكن) يمثل القرار النهائي بناءً على احتمالات الإجابة بـ"نعم" أو "لا".
يمكن استخدام هذا النموذج في مراحل مختلفة من معالجة الذكاء الاصطناعي، سواء قبل إرسال طلب المستخدم إلى نموذج توليدي، أو بعد التوليد لفحص الاستجابة قبل نشرها. وحسب Mistral، يحقق Shieldstral أداءً مماثلاً أو أفضل من نماذج حماية مفتوحة أخرى أكبر منه بسبع مرات في عدة اختبارات معيارية، لا سيما في مجالات الأمان النصي، وكشف الرفض، والتقييم متعدد الوسائط، حيث سجّل معدل نجاح إجمالي بلغ 84.9% في اختبارات الأمان النصي، و83.8% في اختبارات الأمان متعدد الوسائط التي تشمل تحليل الصور.
المصدر: Le Monde Informatique — IA —
الأصلي
