ModelosSeguridad de IA 🇩🇪 05.08.2026 20:02

Shieldstral: el pequeño modelo de código abierto de Mistral supera a clasificadores de seguridad mucho más grandes

MistralMistral OpenAIOpenAI
Un nuevo artículo de Mistral demuestra que su modelo Shieldstral de 3 mil millones de parámetros iguala el rendimiento de clasificadores de seguridad mucho más grandes en pruebas de texto y establece un récord en clasificación multimodal. Shieldstral utiliza un formato simple de pregunta de sí/no, lo que permite a los operadores definir sus propios criterios de seguridad sin necesidad de reentrenamiento.
Según un nuevo artículo, Shieldstral, un modelo de 3 mil millones de parámetros de la empresa francesa de IA Mistral, alcanza en los puntos de referencia comunes de seguridad de texto el rendimiento de modelos tres veces más grandes. Para la clasificación simultánea de texto e imágenes, afirma establecer un nuevo mejor resultado. Los modelos de seguridad existentes a menudo utilizan sistemas de categorías fijas, lo que los autores, incluido el cofundador de Mistral, Guillaume Lample, ven como dos debilidades: los conjuntos de datos de seguridad públicos son demasiado heterogéneos en sus categorías, y las categorías fijas no se adaptan al caso de uso específico. Shieldstral simplifica la moderación de contenido a una pregunta de sí o no: los operadores formulan en lenguaje natural qué se debe verificar, por ejemplo, "¿Este contenido promueve la violencia?", y el modelo responde solo con sí o no. El sistema calcula una puntuación de seguridad entre cero y uno a partir de las probabilidades de ambas respuestas. Los investigadores combinaron alrededor de 54,1 millones de ejemplos de varios conjuntos de datos sobre seguridad, contenido dañino e intentos de manipulación en un formato unificado. Para enseñar al modelo distinciones más finas, hicieron que otro modelo de lenguaje reescribiera textos seguros en variantes inseguras, y cada ejemplo iba acompañado de una categoría similar pero diferente que explícitamente no debía aplicarse. Esto enseñó a Shieldstral a distinguir entre reglas estrechamente relacionadas en lugar de solo aproximadamente entre seguro e inseguro. En los puntos de referencia de texto combinados, Shieldstral alcanza una puntuación F1 de 84,9 por ciento, empatando con el GPT-OSS-Safeguard-20B de OpenAI, que es aproximadamente siete veces más grande, y superando a Qwen3Guard-8B (84,0), Nemotron-3.5-Safety-4B (83,3) y LlamaGuard-4-12B (69,1). Para imágenes y combinaciones de imagen-texto, obtiene 83,8 por ciento, superando a OmniGuard-7B (77,6) y LlavaGuard-7B (71,6). En el punto de referencia de adaptación, GPT-OSS-Safeguard-20B lidera con 94,1 por ciento frente al 91,3 de Shieldstral, pero los autores argumentan que su modelo es más práctico porque los demás producen largos pasos intermedios, lo que aumenta los costos computacionales, mientras que Shieldstral solo emite una sola palabra. Shieldstral se basa en el Ministral-3B de Mistral con reconocimiento de imágenes Pixtral. En una prueba en el conjunto de validación para categorías de grano fino, los datos de categorías sintéticas aumentaron la puntuación F1 en 23,3 puntos porcentuales. Shieldstral está disponible como modelo de pesos abiertos bajo la licencia Apache-2.0. Los clasificadores de seguridad son una capa de validación que se sitúa antes y después del modelo de lenguaje real, verificando las entradas y salidas. La ventaja es que las reglas se pueden cambiar sin reentrenamiento, pero la verificación se ejecuta en cada solicitud, por lo que el tamaño, la velocidad y el costo del clasificador importan. El argumento central de Shieldstral es que si los operadores pueden formular sus propios criterios en tiempo de ejecución, pueden ajustar el filtro para su aplicación en lugar de estar sujetos a un sistema de categorías externo.
Fuente: The Decoder (DE) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas