Seguridad de IAModelos 🇩🇪 06.08.2026 17:02

Mistral lanza un modelo con nueva técnica para clasificaciones de seguridad

MistralMistral
Mistral AI ha presentado Shieldstral, un modelo de seguridad que utiliza un enfoque flexible de preguntas y respuestas para moderar contenido generado por IA. En lugar de categorías fijas, los operadores definen políticas de moderación como preguntas de sí/no en lenguaje natural, y Shieldstral devuelve una puntuación de seguridad. El modelo alcanza un rendimiento comparable al de modelos siete veces más grandes mientras se ejecuta en una GPU Nvidia de 16 GB.
Mistral AI ha presentado Shieldstral, un modelo de seguridad diseñado para simplificar la moderación de contenido generado por IA. Utiliza un enfoque flexible de preguntas y respuestas en lugar de categorías fijas: los operadores formulan sus políticas de moderación como preguntas de sí/no en lenguaje natural, como "¿Este contenido incita a la violencia real?", y Shieldstral devuelve una puntuación de seguridad en función de la cual se puede aprobar o rechazar la solicitud o la respuesta de la IA. Según Mistral, este método tiene dos ventajas: en primer lugar, los operadores pueden ajustar fácilmente las preguntas planteadas sobre el contenido en cualquier momento; en segundo lugar, puede evaluar mejor el contexto del contenido. Por ejemplo, lo que podrían ser citas originales necesarias de discursos contemporáneos en una conferencia escolar sobre campos de concentración sería altamente crítico como contenido para una publicación de blog privada. Los autores del artículo asociado argumentan que los modelos de barrera anteriores con taxonomías fijas no pueden capturar adecuadamente tales diferencias contextuales porque la permisibilidad a menudo está ligada a categorías. El tratamiento de entrada concibe la moderación como una tarea de respuesta a preguntas binarias: el modelo recibe una instrucción del sistema, contexto y una pregunta de sí/no, y durante la inferencia produce solo los logits de sí y no, normalizados mediante softmax en una puntuación de seguridad continua. Mistral afirma que Shieldstral logra el mismo rendimiento que modelos siete veces más grandes, pero funciona en una GPU Nvidia de 16 GB. Técnicamente, Shieldstral se basa en Ministral-3B-Base-2512, un modelo de lenguaje causal de la propia familia de Mistral, que recientemente se amplió con Leanstral 1.5, optimizado para pruebas matemáticas y verificación formal. Para el procesamiento de imágenes, se utiliza un Pixtral-Vision-Encoder. El modelo de 3 mil millones de parámetros está disponible para descarga como pesos abiertos bajo la licencia Apache-2.0 en Hugging Face.
Fuente: Heise online — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas