ModellenAI-veiligheid 🇩🇪 05.08.2026 20:02

Shieldstral: het kleine open-weight model van Mistral verslaat veel grotere veiligheidsclassificatoren

MistralMistral OpenAIOpenAI
Een nieuw onderzoek van Mistral toont aan dat het 3-miljard-parameter model Shieldstral op tekstbenchmarks de prestaties evenaart van veel grotere veiligheidsclassificatoren en een record vestigt op multimodale classificatie. Shieldstral gebruikt een eenvoudig ja/nee-vraagformaat, waardoor operators hun eigen veiligheidscriteria kunnen definiëren zonder hertraining.
Volgens een nieuw onderzoeksartikel behaalt Shieldstral, een model met 3 miljard parameters van het Franse AI-bedrijf Mistral, op gangbare tekstveiligheidsbenchmarks de prestaties van modellen die drie keer zo groot zijn. Voor de gelijktijdige classificatie van tekst en afbeeldingen claimt het een nieuw beste resultaat te vestigen. Bestaande veiligheidsmodellen gebruiken vaak vaste categorieën, wat de auteurs, waaronder Mistral-medeoprichter Guillaume Lample, als twee zwakke punten zien: openbare veiligheidsdatasets zijn te heterogeen in hun categorieën, en vaste categorieën passen zich niet aan de specifieke use case aan. Shieldstral vereenvoudigt contentmoderatie tot een ja/nee-vraag: operators formuleren in natuurlijke taal wat er gecontroleerd moet worden, bijvoorbeeld "Bevordert deze inhoud geweld?", en het model antwoordt alleen met ja of nee. Het systeem berekent een veiligheidsscore tussen nul en één op basis van de kansen van beide antwoorden. De onderzoekers combineerden ongeveer 54,1 miljoen voorbeelden uit verschillende datasets over veiligheid, schadelijke inhoud en manipulatiepogingen tot een uniform formaat. Om het model fijnere onderscheidingen te leren, lieten ze een ander taalmodel veilige teksten herschrijven tot onveilige varianten, en elk voorbeeld ging vergezeld van een vergelijkbare maar andere categorie die expliciet niet van toepassing mocht zijn. Dit leerde Shieldstral om onderscheid te maken tussen nauw verwante regels in plaats van alleen ruwweg tussen veilig en onveilig. Op gecombineerde tekstbenchmarks haalt Shieldstral een F1-score van 84,9 procent, waarmee het gelijk speelt met de ongeveer zeven keer grotere GPT-OSS-Safeguard-20B van OpenAI en hoger scoort dan Qwen3Guard-8B (84,0), Nemotron-3.5-Safety-4B (83,3) en LlamaGuard-4-12B (69,1). Voor afbeeldingen en combinaties van afbeelding en tekst scoort het 83,8 procent, waarmee het OmniGuard-7B (77,6) en LlavaGuard-7B (71,6) verslaat. Op de aanpassingsbenchmark leidt GPT-OSS-Safeguard-20B met 94,1 procent tegenover 91,3 voor Shieldstral, maar de auteurs betogen dat hun model praktischer is omdat de anderen lange tussenstappen produceren die de rekenkosten verhogen, terwijl Shieldstral slechts één woord output. Shieldstral is gebaseerd op Mistral's Ministral-3B met beeldherkenning van Pixtral. In een test op de validatieset voor fijnmazige categorieën verhoogde de synthetische categoriedata de F1-score met 23,3 procentpunten. Shieldstral is beschikbaar als open-weights model onder de Apache-2.0-licentie. Veiligheidsclassificatoren zijn een validatielaag die vóór en na het eigenlijke taalmodel zit en invoer en uitvoer controleert. Het voordeel is dat regels kunnen worden gewijzigd zonder hertraining, maar de controle draait bij elke aanvraag, dus de grootte, snelheid en kosten van de classificator zijn belangrijk. Het kernargument van Shieldstral is dat als operators hun eigen criteria tijdens runtime kunnen formuleren, ze het filter kunnen afstemmen op hun toepassing in plaats van onderworpen te zijn aan een extern categorieënstelsel.
Bron: The Decoder (DE) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws