模型AI安全 🇫🇷 06.08.2026 20:01

Mistral 推出开放模型以管控人工智能生成内容

MistralMistral
Mistral 发布了 Shieldstral,一个拥有 30 亿参数、开放权重(open-weight)的多模态安全模型,旨在检测风险内容并执行治理策略。它可以在配备 16 GB 内存的单块英伟达(Nvidia)图形处理器(GPU)上运行,并以 Apache 2.0 许可证发布。开发者可以通过自然语言问题来定义控制规则。
随着企业越来越多地部署生成式人工智能助手,内容控制正成为一个核心问题。为解决这一问题,Mistral推出了Shieldstral,一个拥有30亿参数、开放权重的多模态安全模型,旨在识别风险内容并应用相应的治理策略。它支持12种语言。该模型在Apache 2.0许可下发布,其权重可供开发者轻松集成和适配,并且可以在配备16 GB显存的单个Nvidia GPU上运行。Shieldstral可在Hugging Face上下载。与传统的基于预定义类别(如暴力、仇恨言论、欺诈或露骨性内容)进行过滤的系统不同,Shieldstral采用了一种可配置的方法,开发者可以将控制规则定义为自然语言问题,例如“此内容是否煽动身体暴力?”请求可以附带指令,指定分析的上下文、预期的严重程度或内容的性质(文本或图像)。该模型提供二元安全评估,仅基于“是”和“否”答案的概率生成一个令牌作为最终决策。它可以在AI处理的不同阶段使用,既可在将用户请求发送至生成模型之前,也可在生成后检查响应再发布。据Mistral称,在多个基准测试中,Shieldstral的表现与比其大七倍的开放防护模型相当或更好,尤其在文本安全、拒绝检测和多模态评估方面,其在文本安全评估中的平均总分为84.9%,在包括图像分析的多模态安全测试中为83.8%。
来源: Le Monde Informatique — IA — 原文
我们之前关于此话题的帖子 ↓
最新新闻