モデルAI安全性 🇫🇷 06.08.2026 20:01

Mistral、AI生成コンテンツを制御するオープンモデルを発表

MistralMistral
Mistralは、リスクのあるコンテンツを検出し、ガバナンスポリシーを適用するために設計された、30億パラメータのオープンウェイト多モーダルセキュリティモデル「Shieldstral」を発表しました。これは、16 GBメモリを搭載した単一のNvidia GPUで動作し、Apache 2.0ライセンスで公開されています。開発者は、自然言語の質問を使用して制御ルールを定義できます。
企業における生成AIアシスタントの導入が進む中、コンテンツ管理は中心的な課題となっています。これに対応するため、Mistralは、リスクのあるコンテンツを特定し、適切なガバナンスポリシーを適用するように設計された、30億パラメータのオープンウェイト・マルチモーダルセキュリティモデルであるShieldstralを発表しました。12言語に対応しています。Apache 2.0ライセンスで公開されており、開発者が簡単に統合・適応できるようモデルの重みを利用可能にしており、16 GBのビデオメモリを備えた単一のNvidia GPUで実行できます。ShieldstralはHugging Faceでダウンロードできます。暴力、ヘイトスピーチ、詐欺、露骨な性的コンテンツなどの事前定義カテゴリでトレーニングされた従来のフィルタリングシステムとは異なり、Shieldstralは構成可能なアプローチを使用し、開発者は制御ルールを自然言語の質問として定義できます。例えば、「このコンテンツは物理的暴力を扇動するか?」などです。リクエストには、分析のコンテキスト、期待される重大度、またはコンテンツの性質(テキストまたは画像)を指定する指示を追加できます。このモデルはバイナリセキュリティ評価を提供し、「はい」と「いいえ」の回答の確率に基づいて最終決定のために単一のトークンを生成します。これはAI処理のさまざまな段階で使用でき、ユーザーリクエストを生成モデルに送信する前や、生成後に応答を公開前にチェックするために使用できます。Mistralによると、Shieldstralは、特にテキスト安全性、拒否検出、マルチモーダル評価において、いくつかのベンチマークで最大7倍大きいオープンガードモデルと同等以上のパフォーマンスを発揮し、テキスト安全性評価で平均グローバルスコア84.9%、画像分析を含むマルチモーダル安全性テストで83.8%を達成しています。
出典: Le Monde Informatique — IA — 原文
関連記事 ↓
新着ニュース