Shieldstral: Mistralin pieni avoimen painon malli päihittää paljon suuremmat turvaluokittelijat
Mistral
OpenAI
Uusi Mistralin tutkimuspaperi osoittaa, että sen 3 miljardin parametrin Shieldstral-malli vastaa paljon suurempien turvaluokittelijoiden suorituskykyä tekstipohjaisissa vertailuissa ja asettaa uuden ennätyksen multimodaalisessa luokittelussa. Shieldstral käyttää yksinkertaista kyllä/ei-kysymysmuotoa, jonka avulla operaattorit voivat määritellä omat turvallisuuskriteerinsä ilman uudelleenkoulutusta.
Uuden artikkelin mukaan ranskalaisen tekoälyyrityksen Mistralin 3 miljardin parametrin Shieldstral-malli saavuttaa yleisissä tekstin turvallisuusvertailuissa kolme kertaa suurempien mallien suorituskyvyn. Tekstin ja kuvien samanaikaisessa luokittelussa se väittää asettavansa uuden parhaan tuloksen. Olemassa olevat turvallisuusmallit käyttävät usein kiinteitä luokitusjärjestelmiä, joiden tekijät, mukaan lukien Mistralin perustajajäsen Guillaume Lample, näkevät kaksi heikkoutta: julkiset turvallisuusaineistot ovat liian heterogeenisiä luokiltaan, eivätkä kiinteät luokat sopeudu käyttötapaukseen. Shieldstral yksinkertaistaa sisällön moderointiin kyllä/ei-kysymykseksi: operaattorit muotoilevat luonnollisella kielellä, mitä pitäisi tarkistaa, esimerkiksi "Edistääkö tämä sisältö väkivaltaa?", ja malli vastaa vain kyllä tai ei. Järjestelmä laskee turvallisuuspisteet nollan ja yhden välillä molempien vastausten todennäköisyyksistä. Tutkijat yhdistivät noin 54,1 miljoonaa esimerkkiä eri turvallisuus-, haitallinen sisältö- ja manipulointiyritysaineistoista yhtenäiseen muotoon. Opettaakseen mallille hienovaraisempia erotteluja he antoivat toisen kielimallin kirjoittaa turvalliset tekstit uudelleen turvattomiksi muunnelmiksi, ja jokaisen esimerkin mukana oli samankaltainen mutta erilainen luokka, jonka ei nimenomaisesti pitänyt sopia. Tämä opetti Shieldstralin erottamaan toisiinsa liittyvät säännöt toisistaan eikä vain karkeasti turvallisen ja turvattoman välillä. Yhdistetyissä teksti-vertailuissa Shieldstral saavuttaa F1-pistemäärän 84,9 prosenttia, mikä on sama kuin noin seitsemän kertaa suuremmalla OpenAI:n GPT-OSS-Safeguard-20B-mallilla ja ylittää Qwen3Guard-8B:n (84,0), Nemotron-3.5-Safety-4B:n (83,3) ja LlamaGuard-4-12B:n (69,1). Kuville ja kuvan ja tekstin yhdistelmille se saa 83,8 prosenttia, päihittäen OmniGuard-7B:n (77,6) ja LlavaGuard-7B:n (71,6). Mukautusvertailussa GPT-OSS-Safeguard-20B johtaa 94,1 prosentilla Shieldstralin 91,3 prosenttia vastaan, mutta tekijät perustelevat, että heidän mallinsa on käytännöllisempi, koska muut tuottavat pitkiä välivaiheita, mikä lisää laskentakustannuksia, kun taas Shieldstral tuottaa vain yhden sanan. Shieldstral perustuu Mistralin Ministral-3B-malliin, jossa on Pixtral-kuvantunnistus. Testissä hienojakoisten luokkien validointijoukolla synteettinen luokka-aineisto nosti F1-pistemäärää 23,3 prosenttiyksikköä. Shieldstral on saatavilla avoimilla painoilla Apache-2.0-lisenssillä. Turvallisuusluokittelijat ovat validointikerros, joka sijaitsee ennen varsinaista kielimallia ja sen jälkeen ja tarkistaa syötteet ja tulosteet. Etuna on, että sääntöjä voidaan muuttaa ilman uudelleenkoulutusta, mutta tarkistus suoritetaan jokaisessa pyynnössä, joten luokittelijan koko, nopeus ja kustannukset ovat merkityksellisiä. Shieldstralin keskeinen argumentti on, että jos operaattorit voivat muotoilla omat kriteerinsä ajonaikaisesti, he voivat virittää suodattimen sovellukseensa sen sijaan, että olisivat vieraan luokitusjärjestelmän alaisia.
Lähde: The Decoder (DE) —
Alkuperäinen
