モデルAI安全性 🇺🇸 04.08.2026 17:03

Mistral AI、ポリシー適応型マルチモーダル安全分類器「Shieldstral」を発表

MistralMistral
Mistral AIは、コンテンツモデレーションをポリシー適応型の質問応答タスクとして捉える、30億パラメータのオープンウェイト・マルチモーダル安全分類器「Shieldstral」を発表しました。これは、最大で7倍の規模のモデルを上回る性能を発揮し、推論時に平易な言語で書かれたポリシーを受け入れ、1台の16GB NVIDIA GPU上で動作します。すべてApache 2.0ライセンスの下で提供されます。
Shieldstralは、Mistral AIがApache 2.0ライセンスの下でリリースした、3Bのオープンウェイトのマルチモーダル安全性分類器です。伝統的なガードレールモデルが、有害性カテゴリの固定された分類を重みに組み込むのとは異なり、Shieldstralは新しいアプローチを採用しています。ユーザーは推論時に安全性ポリシーを平易な英語の質問として書き、モデルは校正された安全性スコアを返します。この定式化により、プロンプト分類、応答モデレーション、拒否検出、毒性検出を単一の問題に統合し、再トレーニングなしでテキストと画像の両方で機能します。このモデルは、テキスト安全性、拒否検出、ポリシー適応性、およびマルチモーダルベンチマークにおいて、最大7倍のサイズのオープンガードモデルと同等かそれ以上の性能を発揮します。単一の16GB NVIDIA GPU上で効率的に実行されます。トレーニングプロセスでは、異種の公開安全性データセットの統合、LLMによって生成された対照ペアによる識別の学習、ビジョン言語の再ランキングによる画像への安全性の基盤付け、およびLoRAとSLERPによる補完的なチェックポイントの組み合わせが行われました。Mistral AIは、Shieldstralを自社のForgeプラットフォーム上でエンドツーエンドで構築しました。同社は、多言語対応、長文ドキュメントの堅牢性、およびより広範なマルチモーダル安全性に引き続き取り組んでいます。Mistral AIはまた、NVIDIAや他の組織とともに、Open Secure AI Allianceの創設メンバーでもあります。
出典: Mistral AI — 原文
関連記事 ↓
新着ニュース