Mistral发布采用新技术的安全分类模型
Mistral
Mistral AI推出了Shieldstral,这是一款安全模型,采用灵活的问-答方法对人工智能生成的内容进行审核。与固定的分类类别不同,操作人员将审核策略定义为自然语言的“是/否”问题,而Shieldstral会返回一个安全分数。该模型在16 GB的Nvidia图形处理器上运行时,其性能与比它大七倍的模型相当。
Mistral AI 推出了 Shieldstral,这是一款旨在简化 AI 生成内容审核的安全模型。它采用灵活的问答方式,而非固定的分类:操作员将审核政策表述为自然语言的“是/否”问题,例如“此内容是否呼吁实际暴力?”,Shieldstral 会返回一个安全评分,据此可批准或拒绝提示或 AI 响应。据 Mistral 称,这种方法有两个优势:首先,操作员可以随时轻松调整关于内容的问题;其次,它可以更好地评估内容的上下文。例如,在关于集中营的学校讲座中,作为当代演讲的必要原文引用可能是合理的,但作为私人博客文章的内容则可能是高度批评性的。相关论文的作者认为,先前具有固定分类的护栏模型无法充分捕捉这种上下文差异,因为许可性往往与类别相关。输入将审核视为二元问答任务:模型接收系统指令、上下文和一个“是/否”问题,在推理时仅输出“是”和“否”的逻辑值,并通过 softmax 归一化为连续的安全评分。Mistral 声称,Shieldstral 能达到七倍大小模型的性能,但可在 16 GB 的 Nvidia GPU 上运行。技术上,Shieldstral 基于 Ministral-3B-Base-2512,这是 Mistral 自家系列中的因果语言模型,最近该系列还新增了 Leanstral 1.5,专门针对数学证明和形式验证进行了优化。对于图像处理,则使用了 Pixtral-Vision-Encoder。这个拥有 30 亿参数的模型可在 Hugging Face 上以 Apache-2.0 许可证作为开放权重下载。
来源: Heise online —
原文
