ModelosSegurança de IA 🇺🇸 09.08.2026 23:01

Mistral AI apresenta Shieldstral 1.0 3B: classificador multimodal aberto de segurança supera modelos 7 vezes maiores

MistralMistral
A Mistral AI lançou o Shieldstral 1.0 3B, um classificador multimodal aberto de segurança, adaptável a políticas. Ele trata a moderação de conteúdo como uma pergunta única sim/não, em vez de uma taxonomia fixa de categorias de dano. O modelo equipara o GPT-OSS-Safeguard-20B em segurança textual e lidera em segurança multimodal.
A Mistral AI lançou o Shieldstral 1.0 3B, um classificador de segurança multimodal de pesos abertos e adaptável a políticas, que trata a moderação de conteúdo como uma única pergunta de sim ou não, em vez de uma taxonomia fixa de categorias de dano. Ao contrário da maioria dos modelos de guarda que incorporam categorias de dano em seus pesos, o Shieldstral permite que os operadores escrevam a política como uma pergunta em linguagem simples no momento da inferência, retornando uma pontuação de segurança calibrada a partir de uma única passagem direta. Construído sobre o Ministral-3-3B-Base-2512 com um codificador de visão Pixtral nativo e lançado sob a licença Apache 2.0, ele reporta uma média de F1 de 84,9% em segurança de texto, igualando o GPT-OSS-Safeguard-20B, e 83,8% em segurança multimodal, à frente de todos os baselines avaliados pela Mistral. O modelo cabe em 16GB de VRAM em BF16, roda em uma única GPU e suporta vLLM, llama.cpp, SGLang e Transformers. Seus dados de treinamento incluem aproximadamente 54,1 milhões de amostras, com geração contrastiva criando exemplos negativos difíceis para ensinar violações específicas de políticas. As fraquezas incluem desempenho inferior em idiomas de baixos recursos, como árabe e indonésio, e confiabilidade reduzida em entradas adversariais ou ofuscadas e em documentos muito longos.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas