TekoälyturvallisuusMallit 🇩🇪 06.08.2026 17:02

Mistral julkaisee mallin uudella tekniikalla turvaluokituksiin

MistralMistral
Mistral AI on esitellyt Shieldstralin, turvallisuusmallin, joka käyttää joustavaa kysymys-vastaus-lähestymistapaa tekoälyn tuottaman sisällön moderointiin. Kiinteiden kategorioiden sijasta operaattorit määrittelevät moderointikäytännöt luonnollisen kielen kyllä/ei-kysymyksinä, ja Shieldstral palauttaa turvallisuuspisteen. Malli saavuttaa suorituskyvyn, joka on verrattavissa seitsemän kertaa suurempiin malleihin, ja se toimii 16 gigatavun Nvidia-näytönohjaimella.
Mistral AI on esitellyt Shieldstral-turvallisuusmallin, joka on suunniteltu yksinkertaistamaan tekoälyn tuottaman sisällön moderointia. Se hyödyntää kiinteiden luokkien sijaan joustavaa kysymys–vastaus-lähestymistapaa: operaattorit muotoilevat moderointikäytäntönsä luonnollisella kielellä esitettyinä kyllä/ei-kysymyksinä, kuten "Kehottaako tämä sisältö todelliseen väkivaltaan?", ja Shieldstral palauttaa turvallisuuspisteytyksen, jonka perusteella kehote tai tekoälyn vastaus voidaan hyväksyä tai hylätä. Mistralin mukaan tällä menetelmällä on kaksi etua: ensinnäkin operaattorit voivat helposti muokata sisällöstä esitettäviä kysymyksiä milloin tahansa; toiseksi malli pystyy arvioimaan sisällön kontekstia paremmin. Esimerkiksi keskitysleireistä kertovassa koulun oppitunnissa saattavat olla tarpeellisia aikalaispuheiden alkuperäiset lainaukset, jotka olisivat sisällöltään erittäin arveluttavia yksityisessä blogikirjoituksessa. Aiheesta kertovan tutkimusartikkelin kirjoittajat väittävät, että aiemmat kiinteään luokitusjärjestelmään (taxonomy) perustuvat suojausmallit eivät pysty riittävästi huomioimaan tällaisia kontekstuaalisia eroja, koska sallittavuus on usein sidottu luokkiin. Shieldstral käsittelee moderoinnin binäärisenä kysymys–vastaus-tehtävänä: malli saa järjestelmäohjeen, kontekstin ja kyllä/ei-kysymyksen, ja päättelyvaiheessa se tuottaa ainoastaan kyllä- ja ei-vastausten logit-arvot, jotka normalisoidaan softmax-funktiolla jatkuvaksi turvallisuuspisteytykseksi. Mistral väittää Shieldstralin saavuttavan saman suorituskyvyn kuin seitsemän kertaa suuremmat mallit, mutta se toimii 16 gigatavun Nvidia-GPU:lla. Teknisesti Shieldstral perustuu Ministral-3B-Base-2512-malliin, joka on kausaalinen kielimalli Mistralin omasta mallien perheestä ja jota laajennettiin äskettäin Leanstral 1.5 -mallilla, joka on optimoitu matemaattisia todistuksia ja formaalia varmennusta varten. Kuvien käsittelyyn käytetään Pixtral-Vision-Encoderia. Kolmen miljardin parametrin malli on ladattavissa avoimina painoina (open weights) Apache-2.0-lisenssillä Hugging Facessa.
Lähde: Heise online — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset