Mistral AI onthult Shieldstral 1.0 3B: open-gewichten multimodale veiligheidsclassificator presteert beter dan modellen die 7x groter zijn
Mistral
Mistral AI heeft Shieldstral 1.0 3B uitgebracht, een open-gewichten, beleidsadaptieve multimodale veiligheidsclassificator. Het behandelt contentmoderatie als een enkele ja/nee-vraag in plaats van een vaste taxonomie van schadecategorieën. Het model evenaart GPT-OSS-Safeguard-20B op tekstveiligheid en leidt op multimodale veiligheid.
Mistral AI heeft Shieldstral 1.0 3B uitgebracht, een open-gewichten, beleidsadaptieve multimodale veiligheidsclassificator die contentmoderatie behandelt als een enkele ja/nee-vraag in plaats van een vaste taxonomie van schadecategorieën. In tegenstelling tot de meeste guardrail-modellen die schadecategorieën in hun gewichten bakken, laat Shieldstral operators het beleid als een vraag in gewone taal schrijven tijdens de inferentie, en retourneert het een gekalibreerde veiligheidsscore uit een enkele forward pass. Gebouwd op Ministral-3-3B-Base-2512 met een native Pixtral-visie-encoder en uitgebracht onder Apache 2.0, rapporteert het een gemiddelde F1 van 84,9% op tekstveiligheid, wat overeenkomt met GPT-OSS-Safeguard-20B, en 83,8% op multimodale veiligheid, voor op alle baselines die Mistral evalueerde. Het model past in 16GB VRAM in BF16, draait op een enkele GPU en ondersteunt vLLM, llama.cpp, SGLang en Transformers. De trainingsdata omvatten ongeveer 54,1M samples, met contrastieve generatie die harde negatieven creëert om beleidsspecifieke overtredingen te leren. Zwakke punten zijn onder meer lagere prestaties op talen met lage middelen zoals Arabisch en Indonesisch, en verminderde betrouwbaarheid bij adversarial of geobfusceerde inputs en zeer lange documenten.
Bron: MarkTechPost —
origineel
