Mistral AI 发布 Shieldstral 1.0 3B:开源权重多模态安全分类器,性能超越同体积 7 倍的模型
Mistral
Mistral AI 发布了 Shieldstral 1.0 3B,这是一个采用开源权重、策略自适应的多模态安全分类器。它将内容审核视为一个简单的是/否问题,而非固定危害类别的分类体系。该模型在文本安全方面与 GPT-OSS-Safeguard-20B 持平,并在多模态安全方面领先。
Mistral AI发布了Shieldstral 1.0 3B,这是一款开放权重、策略自适应的多模态安全分类器,它将内容审核视为一个简单的“是/否”问题,而非固定的危害类别分类法。与大多数将危害类别内置到权重中的护栏模型不同,Shieldstral允许操作者在推理时用自然语言问题编写策略,并通过单次前向传播返回校准的安全评分。该模型基于Ministral-3-3B-Base-2512构建,采用原生Pixtral视觉编码器,以Apache 2.0许可发布。它在文本安全方面报告的平均F1分数为84.9%,与GPT-OSS-Safeguard-20B相当;在多模态安全方面为83.8%,超过了Mistral评估的所有基线。该模型在BF16精度下仅需16GB显存,可在单个GPU上运行,并支持vLLM、llama.cpp、SGLang和Transformers。其训练数据包含约5410万个样本,通过对比生成创建困难负样本,以学习策略特定的违规行为。其弱点包括在阿拉伯语和印尼语等低资源语言上性能较低,以及在对抗性或混淆输入以及超长文档上的可靠性有所下降。
来源: MarkTechPost —
原文
