Mistral presenta un modelo abierto para controlar contenido generado por IA
Mistral
Mistral ha lanzado Shieldstral, un modelo de seguridad multimodal de código abierto con 3 mil millones de parámetros, diseñado para detectar contenido riesgoso y aplicar políticas de gobernanza. Se ejecuta en una única GPU de Nvidia con 16 GB de memoria y se publica bajo la licencia Apache 2.0. Los desarrolladores pueden definir reglas de control mediante preguntas en lenguaje natural.
En medio del creciente despliegue de asistentes de IA generativa en las empresas, el control de contenido se está convirtiendo en un tema central. Para abordar esto, Mistral ha lanzado Shieldstral, un modelo de seguridad multimodal de 3 mil millones de parámetros con pesos abiertos, diseñado para identificar contenido de riesgo y aplicar políticas de gobernanza adecuadas. Soporta 12 idiomas. Publicado bajo Apache 2.0, el modelo pone sus pesos a disposición de los desarrolladores para facilitar su integración y adaptación, y puede ejecutarse en una sola GPU de Nvidia con 16 GB de memoria de video. Shieldstral está disponible para descarga en Hugging Face. A diferencia de los sistemas de filtrado tradicionales entrenados en categorías predefinidas como violencia, discurso de odio, fraude o contenido sexual explícito, Shieldstral utiliza un enfoque configurable donde los desarrolladores pueden definir reglas de control como preguntas en lenguaje natural, por ejemplo, "¿Este contenido incita a la violencia física?". La solicitud puede complementarse con instrucciones que especifiquen el contexto del análisis, la severidad esperada o la naturaleza del contenido (texto o imagen). El modelo proporciona una evaluación de seguridad binaria, generando solo un token para la decisión final basado en las probabilidades de respuestas "sí" y "no". Puede utilizarse en diferentes etapas del procesamiento de IA, ya sea antes de enviar una solicitud de usuario a un modelo generativo o después de la generación para verificar una respuesta antes de su publicación. Según Mistral, Shieldstral se desempeña igual o mejor que los modelos de protección abiertos hasta siete veces más grandes en varios puntos de referencia, particularmente en seguridad textual, detección de rechazo y evaluación multimodal, logrando una puntuación global promedio del 84.9% en evaluaciones de seguridad textual y del 83.8% en pruebas de seguridad multimodal que incluyen análisis de imágenes.
Fuente: Le Monde Informatique — IA —
original
