Mistral onthult open model om AI-gegenereerde inhoud te controleren
Mistral
Mistral heeft Shieldstral gelanceerd, een open-weight multimodaal beveiligingsmodel met 3 miljard parameters, ontworpen om risicovolle inhoud te detecteren en bestuursbeleid te handhaven. Het draait op een enkele Nvidia GPU met 16 GB geheugen en is gepubliceerd onder Apache 2.0. Ontwikkelaars kunnen controleregels definiëren met behulp van vragen in natuurlijke taal.
Te midden van de toenemende inzet van generatieve AI-assistenten in bedrijven wordt inhoudscontrole een centraal vraagstuk. Om dit aan te pakken heeft Mistral Shieldstral gelanceerd, een open-weight multimodaal beveiligingsmodel met 3 miljard parameters, dat is ontworpen om risicovolle inhoud te identificeren en passend governancebeleid toe te passen. Het ondersteunt twaalf talen. Gepubliceerd onder Apache 2.0 maakt het model de gewichten beschikbaar voor ontwikkelaars voor eenvoudige integratie en aanpassing, en het kan draaien op een enkele Nvidia-GPU met 16 GB videogeheugen. Shieldstral is beschikbaar voor download op Hugging Face. In tegenstelling tot traditionele filtersystemen die zijn getraind op vooraf gedefinieerde categorieën zoals geweld, haatspraak, fraude of expliciete seksuele inhoud, gebruikt Shieldstral een configureerbare aanpak waarbij ontwikkelaars controleregels kunnen definiëren als vragen in natuurlijke taal, bijvoorbeeld 'Beleidigt deze inhoud tot fysiek geweld?' De aanvraag kan worden aangevuld met instructies die de context van de analyse, de verwachte ernst of de aard van de inhoud (tekst of afbeelding) specificeren. Het model biedt een binaire veiligheidsevaluatie en genereert slechts één token voor de uiteindelijke beslissing op basis van de kansen op 'ja'- en 'nee'-antwoorden. Het kan in verschillende stadia van AI-verwerking worden gebruikt, zowel vóór het verzenden van een gebruikersverzoek naar een generatief model als na generatie om een reactie te controleren voordat deze wordt gepubliceerd. Volgens Mistral presteert Shieldstral net zo goed of beter dan open guard-modellen die tot zeven keer groter zijn op verschillende benchmarks, met name op het gebied van tekstveiligheid, weigeringsdetectie en multimodale evaluatie. Het behaalt een gemiddelde algemene score van 84,9% op tekstveiligheidsevaluaties en 83,8% op multimodale veiligheidstests inclusief beeldanalyse.
Bron: Le Monde Informatique — IA —
origineel
