MallitTekoälyturvallisuus 🇫🇷 06.08.2026 20:01

Mistral esittelee avoimen mallin tekoälyn tuottaman sisällön hallintaan

MistralMistral
Mistral on julkaissut Shieldstralin, 3 miljardin parametrin avoimen painotetun multimodaalisen turvamallin, joka on suunniteltu havaitsemaan riskialtista sisältöä ja toteuttamaan hallintakäytäntöjä. Se toimii yhdellä Nvidia GPU:lla, jossa on 16 Gt muistia, ja se on julkaistu Apache 2.0 -lisenssillä. Kehittäjät voivat määritellä hallintasääntöjä luonnollisen kielen kysymysten avulla.
Kun generatiivisten tekoälyassistenttien käyttöönotto yrityksissä lisääntyy, sisällönhallinnasta on tulossa keskeinen kysymys. Tämän ratkaisemiseksi Mistral on julkaissut Shieldstralin, 3 miljardin parametrin avoimen painon multimodaalisen turvallisuusmallin, joka on suunniteltu tunnistamaan riskialtis sisältö ja soveltamaan asianmukaisia hallintakäytäntöjä. Se tukee 12 kieltä. Apache 2.0 -lisenssillä julkaistu malli tekee painonsa kehittäjien saataville helpon integroinnin ja mukauttamisen mahdollistamiseksi, ja se voi toimia yhdellä Nvidian GPU:lla, jossa on 16 gigatavua videomuistia. Shieldstral on ladattavissa Hugging Facesta. Toisin kuin perinteiset suodatusjärjestelmät, jotka on koulutettu ennalta määriteltyihin luokkiin, kuten väkivalta, vihapuhe, petokset tai eksplisiittinen seksuaalinen sisältö, Shieldstral käyttää mukautettavaa lähestymistapaa, jossa kehittäjät voivat määritellä hallintasäännöt luonnollisella kielellä esitettävinä kysymyksinä, esimerkiksi: 'Yllyttääkö tämä sisältö fyysiseen väkivaltaan?' Pyyntöä voidaan täydentää ohjeilla, joissa määritellään analyysin konteksti, odotettu vakavuus tai sisällön luonne (teksti tai kuva). Malli antaa binäärisen turvallisuusarvion, tuottaen vain yhden tokenin lopullista päätöstä varten perustuen 'kyllä' ja 'ei' -vastausten todennäköisyyksiin. Sitä voidaan käyttää tekoälyn käsittelyn eri vaiheissa, joko ennen käyttäjäpyynnön lähettämistä generatiiviseen malliin tai generoinnin jälkeen vastauksen tarkistamiseen ennen julkaisua. Mistralin mukaan Shieldstral suoriutuu yhtä hyvin tai paremmin kuin avoimet suojaavat mallit, jotka ovat jopa seitsemän kertaa suurempia, useissa vertailutesteissä, erityisesti tekstin turvallisuudessa, kieltäytymisen tunnistamisessa ja multimodaalisessa arvioinnissa, saavuttaen keskimääräisen kokonaispistemäärän 84,9 prosenttia tekstin turvallisuusarvioinneissa ja 83,8 prosenttia multimodaalisissa turvallisuustesteissä, mukaan lukien kuvien analyysi.
Lähde: Le Monde Informatique — IA — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset