Классификаторы безопасности представляют собой уровень проверки, который располагается до и после собственно языковой модели, контролируя входные и выходные данные. Преимущество такого подхода в том, что правила можно менять без переобучения модели, но проверка выполняется при каждом запросе, поэтому размер, скорость и стоимость работы классификатора имеют значение. Ключевой аргумент Shieldstral в том, что если операторы могут формулировать собственные критерии во время выполнения, они могут настроить фильтр под своё приложение, а не подчиняться навязанной извне системе категорий.