模型AI安全 🇺🇸 04.08.2026 17:03

Mistral AI 发布 Shieldstral:策略自适应的多模态安全分类器

MistralMistral
Mistral AI 推出了 Shieldstral,这是一个参数量为 30 亿的开源权重多模态安全分类器,将内容审核视为策略自适应的问答任务。其性能优于体积高达其七倍的模型,可在推理时接受自然语言策略,并能在单个 16GB 显存的 NVIDIA 图形处理器上运行,全部基于 Apache 2.0 许可证。
Shieldstral 是 Mistral AI 发布的一款 3B 开放权重多模态安全分类器,采用 Apache 2.0 许可证。与将固定伤害类别体系嵌入权重的传统护栏模型不同,Shieldstral 采用了一种新颖的方法:用户在推理时以通俗语言问题形式编写安全策略,模型返回经过校准的安全评分。这种表述将提示分类、响应审核、拒绝检测和毒性检测统一为一个问题,并且无需重新训练即可处理文本和图像。该模型在文本安全、拒绝检测、策略适应性和多模态基准测试方面,匹配或超越了体积高达其 7 倍的开放护栏模型。它可在单个 16GB NVIDIA GPU 上高效运行。训练过程包括统一异构公共安全数据集、通过大语言模型生成的对比对来教授区分能力、利用视觉-语言重排序将安全基于图像,以及通过 LoRA 和 SLERP 组合互补检查点。Mistral AI 在其 Forge 平台上端到端构建了 Shieldstral。公司正在继续致力于多语言覆盖、更长文档的鲁棒性以及更广泛的多模态安全。Mistral AI 也是与 NVIDIA 及其他组织共同成立的开放安全人工智能联盟的创始成员。
来源: Mistral AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻