эротическим запросом на комическую сцену. Только одна модель согласилась написать текст. Модерация основана на продуктовых политиках, определяющих такие категории, как угрозы, ненависть, насилие, самоповреждение, сексуальный контент, жестокое обращение с детьми и оружие. Классификатор на входе присваивает категориям баллы — например, OpenAI Moderation API возвращает 13 меток с подкатегориями. Классификатор может давать ложные срабатывания (блокируя безобидные запросы вроде "как убить скуку") или ложно отрицательные результаты (пропуская вредоносный контент). Компании устанавливают пороговые значения для каждой категории: для самоповреждения приоритетна высокая полнота, для менее опасных категорий важнее может быть точность. Модерация может быть реализована с помощью небольшой большой языковой модели (LLM) на основе промптов или специализированного классификатора. Модераторы на базе LLM гибки, но дороги и подвержены инъекциям промптов; специализированные классификаторы быстрее, но негибки. Лучшая практика включает несколько уровней проверки, подготовку тестового набора со сленгом и опечатками, настройку порогов для каждой категории, проверку длинных диалогов, версионирование конфигураций и логирование решений для ручной проверки.