Cómo funciona la moderación de prompts en servicios de IA: bueno, malo, bloqueado
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
La moderación de prompts sensibles en servicios de IA involucra múltiples etapas: políticas de producto, clasificadores de entrada y filtros de salida. La misma solicitud puede ser manejada de forma diferente por distintos modelos: algunos bloquean, otros advierten, otros cumplen. El artículo compara las respuestas de GPT-5.5 Instant, Claude Sonnet 5 y Grok ante un prompt erótico límite, y explica técnicas de moderación como umbrales de clasificadores, filtros basados en LLM y la importancia del contexto.
La moderación de contenido en los servicios de inteligencia artificial utiliza un sistema de políticas de producto, clasificadores de entrada y filtros de salida. Diferentes modelos reaccionan de manera distinta ante la misma solicitud delicada: uno puede negarse, otro puede señalar detalles cuestionables y un tercero puede cumplirla. El artículo probó GPT-5.5 Instant (ChatGPT), Claude Sonnet 5 y Grok con una petición erótica al límite para una escena de cómic. Solo un modelo aceptó escribir el texto. La moderación se basa en políticas de producto que definen categorías como amenazas, odio, violencia, autolesiones, contenido sexual, abuso infantil y armas. El clasificador de entrada asigna puntuaciones por categoría; por ejemplo, la API de Moderación de OpenAI devuelve 13 etiquetas con subcategorías. El clasificador puede producir falsos positivos (bloqueando consultas inofensivas como 'cómo matar el aburrimiento') o falsos negativos (omitiendo contenido dañino). Las empresas establecen umbrales por categoría: para autolesiones se prioriza un alto nivel de recuperación; para categorías menos peligrosas, la precisión puede ser más importante. La moderación puede implementarse con un modelo de lenguaje pequeño (basado en instrucciones) o un clasificador especializado. Los moderadores basados en modelos de lenguaje son flexibles pero costosos y susceptibles a la inyección de instrucciones; los clasificadores especializados son más rápidos pero rígidos. La mejor práctica implica múltiples niveles de verificación, preparar un conjunto de pruebas con jerga y errores tipográficos, configurar umbrales por categoría, revisar diálogos largos, versionar las configuraciones y registrar las decisiones para revisión manual.
Fuente: Habr — хаб ИИ —
original
