Mistral lança modelo com nova técnica para classificação de segurança
Mistral
A Mistral AI introduziu o Shieldstral, um modelo de segurança que usa uma abordagem flexível de perguntas e respostas para moderar conteúdo gerado por inteligência artificial. Em vez de categorias fixas, os operadores definem políticas de moderação como perguntas de sim/não em linguagem natural, e o Shieldstral retorna uma pontuação de segurança. O modelo alcança desempenho comparável a modelos sete vezes maiores enquanto roda em uma GPU Nvidia de 16 GB.
A Mistral AI apresentou o Shieldstral, um modelo de segurança projetado para simplificar a moderação de conteúdo gerado por IA. Ele usa uma abordagem flexível de pergunta-resposta em vez de categorias fixas: os operadores formulam suas políticas de moderação como perguntas de sim ou não em linguagem natural, como "Este conteúdo pede violência real?", e o Shieldstral retorna uma pontuação de segurança com base na qual o prompt ou a resposta da IA pode ser aprovado ou rejeitado. De acordo com a Mistral, esse método tem duas vantagens: primeiro, os operadores podem facilmente ajustar as perguntas feitas sobre o conteúdo a qualquer momento; segundo, ele pode avaliar melhor o contexto do conteúdo. Por exemplo, o que poderia ser citações originais necessárias de discursos contemporâneos em uma palestra escolar sobre campos de concentração seria altamente crítico como conteúdo para um post em um blog pessoal. Os autores do artigo associado argumentam que modelos de guarda anteriores com taxonomias fixas não conseguem capturar adequadamente tais diferenças contextuais, porque a permissibilidade muitas vezes está ligada a categorias. A entrada trata a moderação como uma tarefa de resposta a perguntas binárias: o modelo recebe uma instrução de sistema, contexto e uma pergunta de sim ou não, e durante a inferência emite apenas os logits de sim e não, normalizados via softmax em uma pontuação de segurança contínua. A Mistral afirma que o Shieldstral atinge o mesmo desempenho que modelos sete vezes maiores, mas roda em uma GPU Nvidia de 16 GB. Tecnicamente, o Shieldstral é baseado no Ministral-3B-Base-2512, um modelo de linguagem causal da própria família da Mistral, que foi recentemente expandido com o Leanstral 1.5, otimizado para provas matemáticas e verificação formal. Para processamento de imagens, é usado um Pixtral-Vision-Encoder. O modelo de 3 bilhões de parâmetros está disponível para download como Open Weights sob a licença Apache-2.0 no Hugging Face.
Fonte: Heise online —
original
