ModelosSegurança de IA 🇫🇷 06.08.2026 20:01

Mistral lança modelo aberto para controlar conteúdo gerado por IA

MistralMistral
A Mistral lançou o Shieldstral, um modelo de segurança multimodal de código aberto com 3 bilhões de parâmetros, projetado para detectar conteúdo arriscado e aplicar políticas de governança. Ele roda em uma única GPU Nvidia com 16 GB de memória e é publicado sob a licença Apache 2.0. Os desenvolvedores podem definir regras de controle usando perguntas em linguagem natural.
Com a crescente implantação de assistentes de IA generativa nas empresas, o controle de conteúdo está se tornando uma questão central. Para abordar isso, a Mistral lançou o Shieldstral, um modelo de segurança multimodal de 3 bilhões de parâmetros com pesos abertos, projetado para identificar conteúdo arriscado e aplicar políticas de governança apropriadas. Ele suporta 12 idiomas. Publicado sob a licença Apache 2.0, o modelo disponibiliza seus pesos para desenvolvedores facilitando a integração e adaptação, e pode ser executado em uma única GPU Nvidia com 16 GB de memória de vídeo. O Shieldstral está disponível para download no Hugging Face. Ao contrário dos sistemas de filtragem tradicionais treinados em categorias predefinidas, como violência, discurso de ódio, fraude ou conteúdo sexual explícito, o Shieldstral usa uma abordagem configurável onde os desenvolvedores podem definir regras de controle como perguntas em linguagem natural, por exemplo, 'Este conteúdo incita violência física?' A solicitação pode ser complementada com instruções especificando o contexto da análise, a gravidade esperada ou a natureza do conteúdo (texto ou imagem). O modelo fornece uma avaliação binária de segurança, gerando apenas um token para a decisão final com base nas probabilidades das respostas 'sim' e 'não'. Ele pode ser usado em diferentes estágios do processamento de IA, seja antes de enviar uma solicitação do usuário a um modelo generativo ou após a geração para verificar uma resposta antes da publicação. De acordo com a Mistral, o Shieldstral tem desempenho igual ou superior a modelos de guarda abertos até sete vezes maiores em vários benchmarks, particularmente em segurança textual, detecção de recusa e avaliação multimodal, alcançando uma pontuação média global de 84,9% nas avaliações de segurança textual e 83,8% nos testes de segurança multimodal, incluindo análise de imagem.
Fonte: Le Monde Informatique — IA — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas