Segurança de IARegulação 🇷🇺 29.07.2026 07:02

Como funciona a moderação de prompts em serviços de IA: bom, ruim, bloqueado

OpenAIOpenAI AnthropicAnthropic xAIxAI Google/DeepMindGoogle/DeepMind ЯндексЯндекс
A moderação de prompts sensíveis em serviços de IA envolve várias etapas: políticas de produto, classificadores de entrada e filtros de saída. A mesma solicitação pode ser tratada de forma diferente por diferentes modelos — alguns bloqueiam, alguns alertam, alguns atendem. O artigo compara as respostas do GPT-5.5 Instant, Claude Sonnet 5 e Grok a um prompt erótico limítrofe e explica técnicas de moderação, incluindo limites de classificadores, filtros baseados em LLM e a importância do contexto.
A moderação de conteúdo em serviços de IA utiliza um sistema de políticas de produto, classificadores de entrada e filtros de saída. Modelos diferentes reagem de forma distinta ao mesmo prompt sensível: um pode recusar, outro pode apontar detalhes questionáveis e um terceiro pode atender. O artigo testou o GPT-5.5 Instant (ChatGPT), o Claude Sonnet 5 e o Grok com uma solicitação erótica de fronteira para uma cena de quadrinhos. Apenas um modelo concordou em escrever o texto. A moderação depende de políticas de produto que definem categorias como ameaças, ódio, violência, automutilação, conteúdo sexual, abuso infantil e armas. O classificador de entrada atribui pontuações por categoria – por exemplo, a API de Moderação da OpenAI retorna 13 rótulos com subcategorias. O classificador pode produzir falsos positivos (bloqueando consultas inofensivas como 'como matar o tédio') ou falsos negativos (deixando passar conteúdo prejudicial). As empresas definem limites por categoria: para automutilação, prioriza-se alta revocação; para categorias menos perigosas, a precisão pode ser mais importante. A moderação pode ser implementada com um LLM pequeno (baseado em prompt) ou um classificador especializado. Moderadores LLM são flexíveis, mas caros e suscetíveis a injeção de prompt; classificadores especializados são mais rápidos, porém rígidos. A prática recomendada envolve múltiplos níveis de verificação, preparar um conjunto de teste com gírias e erros de digitação, configurar limites por categoria, revisar diálogos longos, versionar configurações e registrar decisões para revisão manual.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas