ModelosSegurança de IA 🇩🇪 05.08.2026 20:02

Shieldstral: o pequeno modelo de pesos abertos da Mistral supera classificadores de segurança muito maiores

MistralMistral OpenAIOpenAI
Um novo artigo da Mistral mostra que seu modelo Shieldstral de 3 bilhões de parâmetros iguala o desempenho de classificadores de segurança muito maiores em benchmarks de texto e estabelece um recorde em classificação multimodal. O Shieldstral usa um formato simples de pergunta sim/não, permitindo que operadores definam seus próprios critérios de segurança sem retreinamento.
De acordo com um novo artigo, Shieldstral, um modelo de 3 bilhões de parâmetros da empresa francesa de IA Mistral, alcança em benchmarks comuns de segurança de texto o desempenho de modelos três vezes maiores. Para classificação simultânea de texto e imagens, afirma estabelecer um novo melhor resultado. Modelos de segurança existentes frequentemente usam sistemas de categorias fixas, o que os autores, incluindo o cofundador da Mistral, Guillaume Lample, veem como tendo duas fraquezas: conjuntos de dados públicos de segurança são muito heterogêneos em suas categorias, e categorias fixas não se adaptam ao caso de uso específico. O Shieldstral simplifica a moderação de conteúdo para uma pergunta de sim/não: os operadores formulam em linguagem natural o que deve ser verificado, por exemplo, "Este conteúdo promove violência?", e o modelo responde apenas com sim ou não. O sistema calcula uma pontuação de segurança entre zero e um a partir das probabilidades de ambas as respostas. Os pesquisadores combinaram cerca de 54,1 milhões de exemplos de diversos conjuntos de dados sobre segurança, conteúdo prejudicial e tentativas de manipulação em um formato unificado. Para ensinar o modelo a fazer distinções mais refinadas, eles fizeram outro modelo de linguagem reescrever textos seguros em variantes inseguras, e cada exemplo foi acompanhado por uma categoria semelhante, mas diferente, que explicitamente não deveria se aplicar. Isso ensinou ao Shieldstral distinguir entre regras intimamente relacionadas, em vez de apenas aproximadamente entre seguro e inseguro. Em benchmarks de texto combinados, o Shieldstral atinge uma pontuação F1 de 84,9 por cento, empatando com o cerca de sete vezes maior GPT-OSS-Safeguard-20B da OpenAI e superando Qwen3Guard-8B (84,0), Nemotron-3.5-Safety-4B (83,3) e LlamaGuard-4-12B (69,1). Para imagens e combinações de imagem-texto, ele pontua 83,8 por cento, superando OmniGuard-7B (77,6) e LlavaGuard-7B (71,6). No benchmark de adaptação, o GPT-OSS-Safeguard-20B lidera com 94,1 por cento contra 91,3 do Shieldstral, mas os autores argumentam que seu modelo é mais prático porque os outros produzem longas etapas intermediárias, aumentando os custos computacionais, enquanto o Shieldstral gera apenas uma única palavra. O Shieldstral é baseado no Ministral-3B da Mistral com reconhecimento de imagem Pixtral. Em um teste no conjunto de validação para categorias de grão fino, os dados de categorias sintéticas aumentaram a pontuação F1 em 23,3 pontos percentuais. O Shieldstral está disponível como um modelo de pesos abertos sob a licença Apache-2.0. Classificadores de segurança são uma camada de validação que fica antes e depois do modelo de linguagem real, verificando entradas e saídas. A vantagem é que as regras podem ser alteradas sem retreinamento, mas a verificação é executada em cada solicitação, então o tamanho, a velocidade e o custo do classificador importam. O argumento central do Shieldstral é que, se os operadores puderem formular seus próprios critérios em tempo de execução, eles podem ajustar o filtro para sua aplicação, em vez de estarem sujeitos a um sistema de categorias estrangeiro.
Fonte: The Decoder (DE) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas