मॉडलAI सुरक्षा 🇫🇷 06.08.2026 20:01

Mistral ने AI-जनित सामग्री को नियंत्रित करने के लिए खुला मॉडल पेश किया

MistralMistral
Mistral ने Shieldstral लॉन्च किया है, जो 3-बिलियन-पैरामीटर का एक खुला-वज़न मल्टीमोडल सुरक्षा मॉडल है, जिसे जोखिम भरी सामग्री का पता लगाने और शासन नीतियों को लागू करने के लिए डिज़ाइन किया गया है। यह 16 गीगाबाइट मेमोरी वाले एक Nvidia GPU पर चलता है और Apache 2.0 के तहत प्रकाशित है। डेवलपर्स प्राकृतिक भाषा प्रश्नों का उपयोग करके नियंत्रण नियम परिभाषित कर सकते हैं।
उद्यमों में जनरेटिव एआई सहायकों की बढ़ती तैनाती के बीच, सामग्री नियंत्रण एक केंद्रीय मुद्दा बनता जा रहा है। इससे निपटने के लिए, Mistral ने Shieldstral लॉन्च किया है, जो एक 3-अरब-पैरामीटर वाला ओपन-वेट मल्टीमॉडल सुरक्षा मॉडल है, जिसे जोखिम भरी सामग्री की पहचान करने और उचित शासन नीतियों को लागू करने के लिए डिज़ाइन किया गया है। यह 12 भाषाओं का समर्थन करता है। Apache 2.0 के तहत प्रकाशित, यह मॉडल अपने वेट्स को डेवलपर्स के लिए उपलब्ध कराता है ताकि आसानी से एकीकरण और अनुकूलन हो सके, और यह 16 जीबी वीडियो मेमोरी वाले एकल Nvidia GPU पर चल सकता है। Shieldstral को Hugging Face पर डाउनलोड के लिए उपलब्ध कराया गया है। हिंसा, घृणा भाषण, धोखाधड़ी या स्पष्ट यौन सामग्री जैसी पूर्व-निर्धारित श्रेणियों पर प्रशिक्षित पारंपरिक फ़िल्टरिंग प्रणालियों के विपरीत, Shieldstral एक कॉन्फ़िगर करने योग्य दृष्टिकोण का उपयोग करता है जहाँ डेवलपर्स नियंत्रण नियमों को प्राकृतिक भाषा प्रश्नों के रूप में परिभाषित कर सकते हैं, उदाहरण के लिए, 'क्या यह सामग्री शारीरिक हिंसा को उकसाती है?' अनुरोध को विश्लेषण के संदर्भ, अपेक्षित गंभीरता, या सामग्री की प्रकृति (पाठ या छवि) को निर्दिष्ट करने वाले निर्देशों के साथ पूरक किया जा सकता है। मॉडल एक बाइनरी सुरक्षा मूल्यांकन प्रदान करता है, जो 'हाँ' और 'नहीं' उत्तरों की संभावनाओं के आधार पर अंतिम निर्णय के लिए केवल एक टोकन उत्पन्न करता है। इसका उपयोग एआई प्रोसेसिंग के विभिन्न चरणों में किया जा सकता है, या तो उपयोगकर्ता के अनुरोध को जनरेटिव मॉडल में भेजने से पहले या प्रकाशन से पहले प्रतिक्रिया की जाँच करने के लिए पीढ़ी के बाद। Mistral के अनुसार, Shieldstral कई बेंचमार्कों पर सात गुना बड़े ओपन गार्ड मॉडल के बराबर या उससे बेहतर प्रदर्शन करता है, विशेष रूप से पाठ्य सुरक्षा, अस्वीकृति का पता लगाने और मल्टीमॉडल मूल्यांकन में, पाठ्य सुरक्षा आकलनों पर 84.9% का औसत वैश्विक स्कोर और छवि विश्लेषण सहित मल्टीमॉडल सुरक्षा परीक्षणों पर 83.8% का स्कोर प्राप्त करता है।
स्रोत: Le Monde Informatique — IA — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार