Shieldstral: Mistral का छोटा ओपन-वेट मॉडल बड़े सेफ्टी क्लासिफायर को हराता है
Mistral
OpenAI
Mistral का नया पेपर दिखाता है कि उसका 3-बिलियन-पैरामीटर Shieldstral मॉडल टेक्स्ट बेंचमार्क पर बहुत बड़े सेफ्टी क्लासिफायर के प्रदर्शन से मेल खाता है और मल्टीमॉडल वर्गीकरण में नया रिकॉर्ड स्थापित करता है। Shieldstral सरल हाँ/नहीं प्रश्न प्रारूप का उपयोग करता है, जिससे ऑपरेटर बिना रीट्रेनिंग के अपने स्वयं के सुरक्षा मानदंड परिभाषित कर सकते हैं।
एक नए शोधपत्र के अनुसार, फ्रांसीसी AI कंपनी Mistral का 3-बिलियन पैरामीटर मॉडल Shieldstral, सामान्य टेक्स्ट सुरक्षा बेंचमार्क पर तीन गुना बड़े मॉडलों के प्रदर्शन को प्राप्त करता है। टेक्स्ट और इमेज के एक साथ वर्गीकरण के लिए, यह एक नया सर्वश्रेष्ठ परिणाम स्थापित करने का दावा करता है। मौजूदा सुरक्षा मॉडल अक्सर निश्चित श्रेणी प्रणाली का उपयोग करते हैं, जिसे लेखक, जिनमें Mistral के सह-संस्थापक Guillaume Lample भी शामिल हैं, दो कमजोरियों के रूप में देखते हैं: सार्वजनिक सुरक्षा डेटासेट अपनी श्रेणियों में बहुत विषम हैं, और निश्चित श्रेणियाँ विशिष्ट उपयोग के मामले के अनुकूल नहीं होती हैं। Shieldstral सामग्री मॉडरेशन को एक हाँ/नहीं प्रश्न में सरल करता है: ऑपरेटर प्राकृतिक भाषा में तैयार करते हैं कि क्या जाँचा जाना चाहिए, उदाहरण के लिए, "क्या यह सामग्री हिंसा को बढ़ावा देती है?", और मॉडल केवल हाँ या नहीं में उत्तर देता है। सिस्टम दोनों उत्तरों की संभावनाओं से शून्य से एक के बीच एक सुरक्षा स्कोर की गणना करता है। शोधकर्ताओं ने विभिन्न डेटासेट से सुरक्षा, हानिकारक सामग्री और हेरफेर के प्रयासों के लगभग 54.1 मिलियन उदाहरणों को एक एकीकृत प्रारूप में संयोजित किया। मॉडल को बारीक भेद सिखाने के लिए, उन्होंने एक अन्य भाषा मॉडल से सुरक्षित पाठों को असुरक्षित रूपों में फिर से लिखा, और प्रत्येक उदाहरण के साथ एक समान लेकिन अलग श्रेणी दी गई जो स्पष्ट रूप से लागू नहीं होनी चाहिए। इसने Shieldstral को केवल सुरक्षित और असुरक्षित के बीच मोटे तौर पर अंतर करने के बजाय निकट संबंधित नियमों के बीच अंतर करना सिखाया। संयुक्त पाठ बेंचमार्क पर, Shieldstral 84.9 प्रतिशत का F1 स्कोर प्राप्त करता है, जो लगभग सात गुना बड़े OpenAI के GPT-OSS-Safeguard-20B के बराबर है और Qwen3Guard-8B (84.0), Nemotron-3.5-Safety-4B (83.3), और LlamaGuard-4-12B (69.1) से बेहतर है। इमेज और इमेज-टेक्स्ट संयोजनों के लिए, यह 83.8 प्रतिशत स्कोर करता है, जो OmniGuard-7B (77.6) और LlavaGuard-7B (71.6) को पीछे छोड़ता है। अनुकूलन बेंचमार्क पर, GPT-OSS-Safeguard-20B 94.1 प्रतिशत के साथ आगे है, जबकि Shieldstral 91.3 है, लेकिन लेखकों का तर्क है कि उनका मॉडल अधिक व्यावहारिक है क्योंकि अन्य लंबे मध्यवर्ती चरण उत्पन्न करते हैं, जिससे कम्प्यूटेशनल लागत बढ़ जाती है, जबकि Shieldstral केवल एक शब्द आउटपुट करता है। Shieldstral Mistral के Ministral-3B पर Pixtral इमेज पहचान के साथ आधारित है। बारीक श्रेणियों के लिए सत्यापन सेट पर एक परीक्षण में, सिंथेटिक श्रेणी डेटा ने F1 स्कोर में 23.3 प्रतिशत अंकों की वृद्धि की। Shieldstral Apache-2.0 लाइसेंस के तहत ओपन-वेट मॉडल के रूप में उपलब्ध है। सुरक्षा क्लासिफायर एक सत्यापन परत है जो वास्तविक भाषा मॉडल से पहले और बाद में बैठती है, इनपुट और आउटपुट की जाँच करती है। लाभ यह है कि नियमों को पुनः प्रशिक्षण के बिना बदला जा सकता है, लेकिन जाँच हर अनुरोध पर चलती है, इसलिए क्लासिफायर का आकार, गति और लागत मायने रखती है। Shieldstral का मुख्य तर्क यह है कि यदि ऑपरेटर रनटाइम पर अपने स्वयं के मानदंड तैयार कर सकते हैं, तो वे फ़िल्टर को अपने अनुप्रयोग के लिए ट्यून कर सकते हैं, बजाय एक विदेशी श्रेणी प्रणाली के अधीन होने के।
स्रोत: The Decoder (DE) —
मूल
