Shieldstral возвращает оценку безопасности, на основе которой запрос или ответ ИИ может быть одобрен или отклонён. По словам Mistral, у этого метода два преимущества: во-первых, операторы могут легко корректировать задаваемые вопросы о контенте в любое время; во-вторых, он позволяет лучше оценивать контекст содержания. Например, то, что может быть необходимыми оригинальными цитатами из современных речей в школьной лекции о концентрационных лагерях, было бы крайне критично в качестве контента для личного блога. Авторы сопутствующей статьи утверждают, что предыдущие модели-ограничители с фиксированными таксономиями не могут адекватно отражать такие контекстуальные различия, поскольку допустимость часто связана с категориями. Входные данные трактуют модерацию как задачу бинарного ответа на вопрос: модель получает системную инструкцию, контекст и вопрос «да/нет», а при выводе выдаёт только логиты «да» и «нет», нормализованные с помощью softmax в непрерывную оценку безопасности. Mistral заявляет, что Shieldstral достигает той же производительности, что и модели в семь раз большего размера, но работает на графическом процессоре Nvidia с 16 гигабайтами памяти. Технически Shieldstral основана на Ministral-3B-Base-2512 — каузальной языковой модели из собственного семейства Mistral, которое недавно было расширено моделью Leanstral 1.5, оптимизированной для математических доказательств и формальной верификации. Для обработки изображений используется Pixtral-Vision-Encoder. Модель с тремя миллиардами параметров доступна для загрузки с открытыми весами по лицензии Apache-2.0 на платформе Hugging Face.