фиксированные системы категорий, что авторы, включая сооснователя Mistral Гийома Лампля (Guillaume Lample), считают слабой стороной по двум причинам: публичные наборы данных по безопасности слишком разнородны по своим категориям, а фиксированные категории не адаптируются под конкретный сценарий использования. Shieldstral сводит модерацию контента к вопросу «да/нет»: операторы формулируют на естественном языке, что нужно проверить, например: «Содержит ли этот контент пропаганду насилия?», а модель отвечает только «да» или «нет». Система вычисляет показатель безопасности от нуля до единицы на основе вероятностей обоих ответов. Исследователи объединили около 54,1 миллиона примеров из различных наборов данных о безопасности, вредоносном контенте и попытках манипуляции в единый формат. Чтобы научить модель более тонким различиям, они попросили другую языковую модель переписать безопасные тексты в небезопасные варианты, и к каждому примеру добавлялась похожая, но отличающаяся категория, которая явно не должна применяться. Это научило Shieldstral различать близкие по смыслу правила, а не просто грубо делить контент на безопасный и небезопасный.
Показать ещё ↓