AI-veiligheidModellen 🇩🇪 06.08.2026 17:02

Mistral brengt model uit met nieuwe techniek voor veiligheidsclassificaties

MistralMistral
Mistral AI heeft Shieldstral geïntroduceerd, een veiligheidsmodel dat een flexibele vraag-antwoordbenadering gebruikt voor het modereren van door AI gegenereerde inhoud. In plaats van vaste categorieën definiëren operators moderatiebeleid als ja/nee-vragen in natuurlijke taal, en Shieldstral geeft een veiligheidsscore terug. Het model presteert vergelijkbaar met modellen die zeven keer groter zijn, terwijl het draait op een Nvidia GPU met 16 GB geheugen.
Mistral AI heeft Shieldstral gepresenteerd, een veiligheidsmodel dat is ontworpen om de moderatie van AI-gegenereerde inhoud te vereenvoudigen. Het maakt gebruik van een flexibele vraag-antwoordbenadering in plaats van vaste categorieën: beheerders formuleren hun moderatiebeleid als natuurlijke taal ja/nee-vragen, zoals 'Roep deze inhoud op tot echt geweld?', en Shieldstral geeft een veiligheidsscore op basis waarvan de prompt of AI-reactie kan worden goedgekeurd of afgewezen. Volgens Mistral heeft deze methode twee voordelen: ten eerste kunnen beheerders de gestelde vragen over de inhoud op elk moment eenvoudig aanpassen; ten tweede kan het de context van inhoud beter beoordelen. Zo kan wat in een schoolles over concentratiekampen noodzakelijke originele citaten uit hedendaagse toespraken zijn, zeer kritisch zijn als inhoud voor een persoonlijke blogpost. De auteurs van het bijbehorende paper betogen dat eerdere guardrail-modellen met vaste taxonomieën dergelijke contextuele verschillen niet adequaat kunnen vastleggen, omdat toelaatbaarheid vaak aan categorieën is gekoppeld. Invoer behandelt moderatie als een binaire vraag-antwoordtaak: het model ontvangt een systeeminstructie, context en een ja/nee-vraag, en geeft tijdens inferentie alleen de ja- en nee-logits uit, genormaliseerd via softmax tot een continue veiligheidsscore. Mistral claimt dat Shieldstral dezelfde prestaties behaalt als zeven keer grotere modellen, maar draait op een 16 GB Nvidia-GPU. Technisch gezien is Shieldstral gebaseerd op Ministral-3B-Base-2512, een causaal taalmodel uit Mistral's eigen familie, dat onlangs is uitgebreid met Leanstral 1.5, geoptimaliseerd voor wiskundige bewijzen en formele verificatie. Voor beeldverwerking wordt een Pixtral-Vision-Encoder gebruikt. Het model met 3 miljard parameters is beschikbaar om te downloaden als Open Weights onder de Apache-2.0-licentie op Hugging Face.
Bron: Heise online — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws