Mistral AI esittelee Shieldstral 1.0 3B:n: avoimen painojen multimodaalinen turvaluokittelija ylittää 7 kertaa suuremmat mallit
Mistral
Mistral AI on julkaissut Shieldstral 1.0 3B:n, avoimen painojen ja käytäntöihin mukautuvan multimodaalisen turvaluokittelijan. Se käsittelee sisällön moderointia yhtenä kyllä/ei-kysymyksenä kiinteän haittakategorioiden taksonomian sijaan. Malli vastaa GPT-OSS-Safeguard-20B:tä tekstin turvallisuudessa ja johtaa multimodaalisessa turvallisuudessa.
Mistral AI on julkaissut Shieldstral 1.0 3B:n, joka on avoimen painoarvojen, käytäntöön mukautuvan multimodaalisen turvaluokittelijan malli. Se käsittelee sisällön moderointia yhtenä kyllä/ei-kysymyksenä sen sijaan, että se käyttäisi kiinteää vahinkoluokkien taksonomiaa. Toisin kuin useimmat suojakaide-mallit, jotka sisältävät vahinkoluokat painoarvoissaan, Shieldstral antaa operaattoreille mahdollisuuden kirjoittaa käytännön selkokielisenä kysymyksenä päätelmäajassa, palauttaen kalibroidun turvallisuuspistemäärän yhdestä läpiviennistä. Se on rakennettu Ministral-3-3B-Base-2512-pohjalle, jossa on natiivi Pixtral-näköenkooderi, ja julkaistu Apache 2.0 -lisenssillä. Se raportoi 84,9 prosentin keskimääräisen F1-pistemäärän tekstin turvallisuudessa, mikä vastaa GPT-OSS-Safeguard-20B-mallia, ja 83,8 prosentin multimodaalisessa turvallisuudessa, mikä on parempi kuin kaikki Mistralin arvioimat perusmallit. Malli mahtuu 16 gigatavuun VRAM-muistia BF16-tarkkuudella, toimii yhdellä grafiikkaprosessorilla ja tukee vLLM-, llama.cpp-, SGLang- ja Transformers-kirjastoja. Sen opetusdata sisältää noin 54,1 miljoonaa näytettä, ja kontrastiivinen generointi luo vaikeita negatiivisia esimerkkejä opettaakseen käytäntökohtaisia rikkomuksia. Heikkouksia ovat alhaisempi suorituskyky niukkojen kielten, kuten arabian ja indonesian, kohdalla sekä heikentynyt luotettavuus hyökkäävien tai hämärien syötteiden ja hyvin pitkien dokumenttien kanssa.
Lähde: MarkTechPost —
Alkuperäinen
