模型AI安全 🇩🇪 05.08.2026 20:02

Shieldstral:Mistral 的小型开源权重模型胜过更大的安全分类器

MistralMistral OpenAIOpenAI
Mistral 的一篇新论文显示,其拥有30亿参数的 Shieldstral 模型在文本基准测试中与更大的安全分类器性能相当,并在多模态分类方面创下了纪录。Shieldstral 采用简单的“是/否”问答格式,允许操作者无需重新训练即可自定义安全标准。
根据一篇新论文,法国AI公司Mistral推出的30亿参数模型Shieldstral在常见文本安全基准测试中,其性能达到了三倍大小模型的水准。在文本和图像的同步分类任务中,它声称创下了新的最佳结果。现有的安全模型通常使用固定的分类体系,而包括Mistral联合创始人Guillaume Lample在内的作者认为这存在两个弱点:公开的安全数据集在类别上过于异构,且固定类别无法适应具体的使用场景。Shieldstral将内容审核简化为一个“是/否”问题:操作者用自然语言表述需要检查的内容,例如“此内容是否宣扬暴力?”,模型仅以“是”或“否”作答。系统根据两种回答的概率计算出一个介于0到1之间的安全评分。研究人员将来自不同数据集的约5410万个关于安全、有害内容和操纵尝试的示例统一为一种格式。为了教授模型更精细的区分,他们让另一个语言模型将安全文本改写为不安全变体,并且每个示例都附带一个相似但不相同的类别,明确指出该类别不适用。这使Shieldstral学会了区分紧密相关的规则,而非仅仅粗略区分安全与不安全。在文本基准测试的综合结果中,Shieldstral的F1分数达到84.9%,与OpenAI的约七倍大小的GPT-OSS-Safeguard-20B持平,并超过了Qwen3Guard-8B(84.0)、Nemotron-3.5-Safety-4B(83.3)和LlamaGuard-4-12B(69.1)。在图像及图像-文本组合上,其得分为83.8%,优于OmniGuard-7B(77.6)和LlavaGuard-7B(71.6)。在适应基准测试中,GPT-OSS-Safeguard-20B以94.1%领先于Shieldstral的91.3%,但作者认为他们的模型更实用,因为其他模型会产生冗长的中间步骤,增加计算成本,而Shieldstral仅输出一个词。Shieldstral基于Mistral的Ministral-3B,并集成了Pixtral图像识别功能。在细粒度类别的验证集测试中,合成类别数据使F1分数提升了23.3个百分点。Shieldstral以Apache-2.0许可证作为开放权重模型提供。安全分类器是一个验证层,位于实际语言模型之前和之后,用于检查输入和输出。其优势在于可以在不重新训练的情况下更改规则,但每次请求都会执行检查,因此分类器的大小、速度和成本就显得至关重要。Shieldstral的核心论点是,如果操作者能够在运行时制定自己的标准,他们就可以针对自己的应用调整过滤器,而不是受制于外部的类别体系。
来源: The Decoder (DE) — 原文
我们之前关于此话题的帖子 ↓
最新新闻