Mistral AI brengt Shieldstral uit: een policy-adaptieve multimodale veiligheidsclassificator
Mistral
Mistral AI heeft Shieldstral geïntroduceerd, een open-weights multimodale veiligheidsclassificator met 3B-parameters die contentmoderatie benadert als een policy-adaptieve vraag-antwoordtaak. Het presteert beter dan modellen tot 7 keer zo groot, accepteert beleid in gewone taal tijdens de inferentie en draait op een enkele NVIDIA GPU met 16GB geheugen, allemaal onder Apache 2.0.
Shieldstral is een open-gewichten multimodale veiligheidsclassificator van 3B, uitgebracht door Mistral AI onder de Apache 2.0-licentie. In tegenstelling tot traditionele guardrail-modellen die een vaste taxonomie van schadecategorieën in hun gewichten bakken, hanteert Shieldstral een nieuwe aanpak: gebruikers schrijven het veiligheidsbeleid als een vraag in gewone taal op het moment van inferentie, en het model retourneert een gekalibreerde veiligheidsscore. Deze formulering verenigt promptclassificatie, responsmatiging, weigeringsdetectie en toxiciteitsdetectie in één enkel probleem, en werkt voor zowel tekst als afbeeldingen zonder hertraining. Het model evenaart of overtreft open guard-modellen tot 7x zijn grootte op het gebied van tekstveiligheid, weigeringsdetectie, beleidsaanpassingsvermogen en multimodale benchmarks. Het draait efficiënt op een enkele NVIDIA-GPU van 16 GB. Het trainingsproces omvatte het verenigen van heterogene openbare veiligheidsdatasets, het aanleren van discriminatie door middel van contrastieve paren gegenereerd door een LLM, het verankeren van veiligheid in afbeeldingen met vision-language-reranking, en het combineren van complementaire checkpoints via LoRA en SLERP. Mistral AI bouwde Shieldstral end-to-end op zijn Forge-platform. Het bedrijf blijft werken aan meertalige dekking, robuustheid voor langere documenten en bredere multimodale veiligheid. Mistral AI is ook een van de oprichters van de Open Secure AI Alliance met NVIDIA en andere organisaties.
Bron: Mistral AI —
origineel
