شيلدسترال: نموذج ميسترال الصغير مفتوح الوزن يتفوق على مصنفات السلامة الأكبر بكثير
Mistral
OpenAI
ورقة بحثية جديدة من ميسترال تُظهر أن نموذج شيلدسترال الذي يبلغ 3 مليارات معلمة يضاهي أداء مصنفات السلامة الأكبر بكثير على معايير النصوص ويسجل رقمًا قياسيًا في التصنيف متعدد الوسائط. يستخدم شيلدسترال صيغة سؤال بسيطة بنعم/لا، مما يسمح للمشغلين بتحديد معايير السلامة الخاصة بهم دون إعادة تدريب.
وفقًا لورقة بحثية جديدة، يحقق نموذج Shieldstral، وهو نموذج بمعاملات يبلغ عددها 3 مليارات من شركة الذكاء الاصطناعي الفرنسية Mistral، أداءً في معايير السلامة النصية الشائعة يعادل أداء نماذج أكبر بثلاث مرات. وفي التصنيف المتزامن للنصوص والصور، يدعي النموذج تحقيق أفضل نتيجة جديدة. غالبًا ما تستخدم نماذج السلامة الحالية أنظمة فئات ثابتة، وهو ما يراه المؤلفون، بمن فيهم المؤسس المشارك لـ Mistral غيوم لامبل، على أنه ينطوي على ضعفين: مجموعات بيانات السلامة العامة غير متجانسة في فئاتها، والفئات الثابتة لا تتكيف مع حالة الاستخدام المحددة. يبسّط Shieldstral الإشراف على المحتوى إلى سؤال بنعم/لا: يقوم المشغلون بصياغة ما يجب التحقق منه بلغة طبيعية، مثل: "هل يعزز هذا المحتوى العنف؟"، ويستجيب النموذج فقط بنعم أو لا. يحسب النظام درجة أمان تتراوح بين صفر وواحد من احتمالات الإجابتين. جمع الباحثون حوالي 54.1 مليون مثال من مجموعات بيانات مختلفة حول السلامة والمحتوى الضار ومحاولات التلاعب في تنسيق موحد. لتعليم النموذج تمييزات أدق، قام نموذج لغوي آخر بإعادة كتابة النصوص الآمنة إلى نسخ غير آمنة، وكان كل مثال مصحوبًا بفئة مشابهة ولكن مختلفة يجب ألا تنطبق عليه صراحةً. هذا درب Shieldstral على التمييز بين القواعد وثيقة الصلة بدلاً من مجرد التمييز التقريبي بين الآمن وغير الآمن. في المعايير النصية المجمعة، يصل Shieldstral إلى درجة F1 تبلغ 84.9 بالمئة، متعادلاً مع نموذج GPT-OSS-Safeguard-20B من OpenAI الأكبر بحوالي سبع مرات، ومتفوقًا على Qwen3Guard-8B (84.0)، وNemotron-3.5-Safety-4B (83.3)، وLlamaGuard-4-12B (69.1). بالنسبة للصور ومجموعات الصور والنصوص، يسجل 83.8 بالمئة، متغلبًا على OmniGuard-7B (77.6) وLlavaGuard-7B (71.6). في معيار التكيف، يتصدر GPT-OSS-Safeguard-20B بنسبة 94.1 بالمئة مقابل 91.3 لـ Shieldstral، لكن المؤلفين يجادلون بأن نموذجهم أكثر عملية لأن النماذج الأخرى تنتج خطوات وسيطة طويلة، مما يزيد التكاليف الحسابية، بينما ينتج Shieldstral كلمة واحدة فقط. يعتمد Shieldstral على Ministral-3B من Mistral مع تقنية التعرف على الصور Pixtral. في اختبار على مجموعة التحقق من الصحة للفئات الدقيقة، زادت بيانات الفئات الاصطناعية درجة F1 بمقدار 23.3 نقطة مئوية. يتوفر Shieldstral كنموذج مفتوح الأوزان تحت رخصة Apache-2.0. مصنفات السلامة هي طبقة تحقق تقع قبل وبعد نموذج اللغة الفعلي، وتتحقق من المدخلات والمخرجات. الميزة هي أنه يمكن تغيير القواعد دون إعادة تدريب، ولكن الفحص يعمل على كل طلب، لذا فإن حجم المصنف وسرعته وتكلفته مهمة. الحجة الأساسية لـ Shieldstral هي أنه إذا تمكن المشغلون من صياغة معاييرهم الخاصة في وقت التشغيل، فيمكنهم ضبط الفلتر لتطبيقهم بدلاً من الخضوع لنظام فئات خارجي.
المصدر: The Decoder (DE) —
الأصلي
