Mistral dévoile un modèle ouvert pour contrôler le contenu généré par l'IA
Mistral
Mistral a lancé Shieldstral, un modèle de sécurité multimodal ouvert de 3 milliards de paramètres, conçu pour détecter les contenus à risque et appliquer des politiques de gouvernance. Il fonctionne sur un seul GPU Nvidia avec 16 Go de mémoire et est publié sous licence Apache 2.0. Les développeurs peuvent définir des règles de contrôle à l'aide de questions en langage naturel.
Face au déploiement croissant des assistants d'IA générative dans les entreprises, le contrôle du contenu devient un enjeu central. Pour y répondre, Mistral a lancé Shieldstral, un modèle de sécurité multimodal open-weight de 3 milliards de paramètres, conçu pour identifier les contenus à risque et appliquer des politiques de gouvernance adaptées. Il prend en charge 12 langues. Publié sous licence Apache 2.0, le modèle met ses poids à disposition des développeurs pour une intégration et une adaptation faciles, et il peut fonctionner sur un seul GPU Nvidia avec 16 Go de mémoire vidéo. Shieldstral est disponible en téléchargement sur Hugging Face. Contrairement aux systèmes de filtrage traditionnels entraînés sur des catégories prédéfinies telles que la violence, les discours haineux, la fraude ou le contenu sexuel explicite, Shieldstral utilise une approche configurable où les développeurs peuvent définir des règles de contrôle sous forme de questions en langage naturel, par exemple : « Ce contenu incite-t-il à la violence physique ? » La requête peut être complétée par des instructions spécifiant le contexte d'analyse, la sévérité attendue ou la nature du contenu (texte ou image). Le modèle fournit une évaluation binaire de la sécurité, générant un seul jeton pour la décision finale en fonction des probabilités de réponses « oui » et « non ». Il peut être utilisé à différentes étapes du traitement de l'IA, soit avant d'envoyer une requête utilisateur à un modèle génératif, soit après la génération pour vérifier une réponse avant publication. Selon Mistral, Shieldstral obtient des performances égales ou supérieures à celles des modèles de garde ouverts jusqu'à sept fois plus grands sur plusieurs références, notamment en matière de sécurité textuelle, de détection de refus et d'évaluation multimodale, atteignant un score global moyen de 84,9 % sur les évaluations de sécurité textuelle et de 83,8 % sur les tests de sécurité multimodale incluant l'analyse d'images.
Source: Le Monde Informatique — IA —
original
