языков. Опубликованная под лицензией Apache 2.0 (открытая программная лицензия), модель предоставляет разработчикам доступ к весам для удобной интеграции и адаптации, а её можно запускать на одном графическом процессоре (GPU) Nvidia с 16 ГБ видеопамяти. Shieldstral доступна для загрузки на платформе Hugging Face. В отличие от традиционных систем фильтрации, обученных на заранее заданных категориях, таких как насилие, разжигание ненависти, мошенничество или откровенный сексуальный контент, Shieldstral использует настраиваемый подход, при котором разработчики могут задавать правила контроля в виде вопросов на естественном языке, например: «Побуждает ли этот контент к физическому насилию?». Запрос можно дополнить инструкциями, уточняющими контекст анализа, ожидаемую степень серьёзности или характер контента (текст или изображение). Модель выдаёт бинарную оценку безопасности, генерируя всего один токен для итогового решения на основе вероятностей ответов «да» и «нет». Её можно использовать на разных этапах обработки данных ИИ: либо перед отправкой запроса пользователя генеративной модели, либо после генерации — для проверки ответа перед публикацией. По данным Mistral, Shieldstral демонстрирует результаты не хуже, а иногда и лучше, чем открытые модели-защитники, размер которых в семь раз больше, по ряду тестов, в частности в оценке текстовой безопасности, обнаружении отказов и мультимодальной оценке, достигая среднего глобального показателя 84,9% в тестах на текстовую безопасность и 83,8% в мультимодальных тестах безопасности, включающих анализ изображений.