AI安全性モデル 🇩🇪 06.08.2026 17:02

Mistral、安全性分類の新技術を備えたモデルをリリース

MistralMistral
Mistral AI は、AI が生成したコンテンツをモデレーションするための柔軟な質問応答アプローチを採用した安全モデル Shieldstral を発表しました。固定カテゴリの代わりに、オペレーターはモデレーションポリシーを自然言語のイエス・ノー質問として定義し、Shieldstral は安全性スコアを返します。このモデルは、16 GB の Nvidia GPU で動作しながら、7 倍のサイズのモデルに匹敵するパフォーマンスを達成しています。
Mistral AIは、AI生成コンテンツのモデレーションを簡素化するために設計されたセーフティモデル、Shieldstralを発表しました。これは固定カテゴリではなく、柔軟な質問回答アプローチを採用しています。オペレーターは、「このコンテンツは実際の暴力を呼びかけるものですか?」といった自然言語のイエス・ノー質問としてモデレーションポリシーを定式化し、Shieldstralはそれに基づいてプロンプトまたはAI応答を承認または拒否できるセーフティスコアを返します。Mistralによると、この方法には2つの利点があります。第一に、オペレーターはいつでもコンテンツに関する質問を簡単に調整できること、第二に、コンテンツの文脈をより適切に評価できることです。例えば、学校の講義で強制収容所について話す際の現代のスピーチからの必要な原文引用は、個人のブログ投稿のコンテンツとしては非常に批判的である可能性があります。関連論文の著者は、固定された分類法を持つ従来のガードレールモデルは、許容性がしばしばカテゴリに結びついているため、このような文脈の違いを適切に捉えることができないと主張しています。入力はモデレーションを二値の質問回答タスクとして扱います。モデルはシステム指示、文脈、およびイエス・ノー質問を受け取り、推論中にイエスとノーのロジットのみを出力し、ソフトマックス関数で正規化して連続的なセーフティスコアに変換します。Mistralは、Shieldstralが7倍の規模のモデルと同じ性能を達成しながら、16 GBのNvidia GPU上で動作すると主張しています。技術的には、ShieldstralはMistral自身のファミリーに属する因果言語モデルであるMinistral-3B-Base-2512に基づいており、最近では数学的証明と形式的検証に最適化されたLeanstral 1.5で拡張されました。画像処理には、Pixtral-Vision-Encoderが使用されています。30億パラメータのモデルは、Apache-2.0ライセンスのオープンウェイトとしてHugging Faceでダウンロード可能です。
出典: Heise online — 原文
関連記事 ↓
新着ニュース