Mistral AI ने पेश किया Shieldstral 1.0 3B: ओपन-वेट मल्टीमॉडल सेफ्टी क्लासिफायर जो अपने आकार से 7 गुना बड़े मॉडल्स को पीछे छोड़ता है
Mistral
Mistral AI ने Shieldstral 1.0 3B जारी किया है, जो एक ओपन-वेट, पॉलिसी-अनुकूल मल्टीमॉडल सेफ्टी क्लासिफायर है। यह कंटेंट मॉडरेशन को हानि श्रेणियों की एक निश्चित सूची के बजाय एक सरल हां/नहीं प्रश्न के रूप में मानता है। मॉडल पाठ सुरक्षा में GPT-OSS-Safeguard-20B के बराबर प्रदर्शन करता है और मल्टीमॉडल सुरक्षा में आगे रहता है।
Mistral AI ने Shieldstral 1.0 3B जारी किया है, जो एक ओपन-वेट, पॉलिसी-अनुकूलनीय मल्टीमॉडल सेफ्टी क्लासिफायर है, जो कंटेंट मॉडरेशन को हानि श्रेणियों की निश्चित सूची के बजाय एक ही हाँ/नहीं प्रश्न के रूप में मानता है। अधिकांश गार्डरेल मॉडलों के विपरीत, जो हानि श्रेणियों को अपने वेट में स्थिर कर देते हैं, Shieldstral ऑपरेटरों को इन्फरेंस के समय पॉलिसी को सादे भाषा के प्रश्न के रूप में लिखने की अनुमति देता है, और एक ही फॉरवर्ड पास से एक कैलिब्रेटेड सेफ्टी स्कोर लौटाता है। Ministral-3-3B-Base-2512 पर निर्मित, जिसमें मूल Pixtral विज़न एनकोडर है और Apache 2.0 के तहत जारी किया गया है, यह टेक्स्ट सुरक्षा पर 84.9% औसत F1 रिपोर्ट करता है, जो GPT-OSS-Safeguard-20B के बराबर है, और मल्टीमॉडल सुरक्षा पर 83.8%, जो Mistral द्वारा मूल्यांकन किए गए सभी बेसलाइनों से आगे है। मॉडल BF16 में 16GB VRAM में फिट बैठता है, एक ही GPU पर चलता है, और vLLM, llama.cpp, SGLang और Transformers का समर्थन करता है। इसका प्रशिक्षण डेटा लगभग 54.1M नमूनों का है, जिसमें कॉन्ट्रास्टिव जनरेशन कठिन नकारात्मक उदाहरण बनाकर पॉलिसी-विशिष्ट उल्लंघन सिखाता है। कमजोरियों में अरबी और इंडोनेशियाई जैसी कम-संसाधन भाषाओं पर कम प्रदर्शन, और विरोधात्मक या अस्पष्ट इनपुट तथा बहुत लंबे दस्तावेज़ों पर कम विश्वसनीयता शामिल है।
स्रोत: MarkTechPost —
मूल
