Mistral AI、オープンウェイトのマルチモーダル安全分類器「Shieldstral 1.0 3B」を公開――7倍の規模のモデルを凌駕
Mistral
Mistral AIは、オープンウェイトかつポリシー適応型のマルチモーダル安全分類器「Shieldstral 1.0 3B」をリリースしました。このモデルは、コンテンツモデレーションを固定された有害カテゴリの分類ではなく、単一のイエス・ノー質問として扱います。テキスト安全性ではGPT-OSS-Safeguard-20Bに匹敵し、マルチモーダル安全性でリードしています。
Mistral AIは、オープンウェイトでポリシー適応型のマルチモーダル安全分類器であるShieldstral 1.0 3Bをリリースしました。これは、コンテンツモデレーションを固定された有害カテゴリの分類ではなく、単一のイエス/ノーの質問として扱います。ほとんどのガードレールモデルが有害カテゴリをウェイトに組み込んでいるのとは異なり、Shieldstralはオペレーターが推論時にポリシーを平易な言語の質問として記述できるようにし、単一のフォワードパスから校正された安全スコアを返します。Ministral-3-3B-Base-2512をベースに、ネイティブのPixtralビジョンエンコーダを備え、Apache 2.0ライセンスで公開されています。テキスト安全性では平均F1スコア84.9%を報告し、GPT-OSS-Safeguard-20Bに匹敵し、マルチモーダル安全性では83.8%で、Mistralが評価したすべてのベースラインを上回っています。このモデルはBF16で16GBのVRAMに収まり、単一のGPUで動作し、vLLM、llama.cpp、SGLang、Transformersをサポートしています。トレーニングデータには約5,410万サンプルが含まれ、対比生成によってハードネガティブを作成し、ポリシー固有の違反を学習させています。弱点としては、アラビア語やインドネシア語などの低リソース言語での性能が低いこと、および敵対的または難読化された入力や非常に長い文書での信頼性が低下することが挙げられます。
出典: MarkTechPost —
原文
