AI 服务中的提示词审核机制:合规、警告与拒绝
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
AI 服务中对敏感提示词的审核涉及多个阶段:产品政策、输入分类器和输出过滤器。同一请求在不同模型中的处理方式可能不同——有的拒绝,有的警告,有的则直接执行。文章比较了 GPT-5.5 Instant、Claude Sonnet 5 和 Grok 对一个边缘色情提示的响应,并解释了审核技术,包括分类器阈值、基于大语言模型的过滤器以及上下文的重要性。
AI服务中的内容审核采用产品政策、输入分类器和输出过滤器的系统。不同模型对同一敏感提示词的反应各异:一个可能拒绝,另一个可能指出可疑细节,第三个可能服从。文章使用GPT-5.5 Instant(ChatGPT)、Claude Sonnet 5和Grok测试了一个涉及情色边缘的漫画场景请求。只有一个模型同意撰写文本。审核依赖于产品政策,这些政策定义了威胁、仇恨、暴力、自我伤害、色情内容、儿童虐待和武器等类别。输入分类器会分配类别分数——例如,OpenAI的Moderation API返回13个带有子类别的标签。分类器可能产生误报(如屏蔽“如何消磨无聊时间”这样的无害查询)或漏报(错过有害内容)。公司为每个类别设置阈值:对于自我伤害,优先考虑高召回率;对于危险性较低的类别,精确度可能更重要。审核可以通过小型大型语言模型(基于提示)或专用分类器实施。大型语言模型审核员灵活但成本高且易受提示注入影响;专用分类器速度更快但灵活性差。最佳实践包括多个验证级别、准备包含俚语和错别字的测试集、配置每个类别的阈值、审核长对话、对配置进行版本控制以及记录决策以供人工审查。
来源: Habr — хаб ИИ —
原文
