AIサービスにおけるプロンプトモデレーションの仕組み:良、悪、ブロック
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
AIサービスにおけるセンシティブなプロンプトのモデレーションは、製品ポリシー、入力分類器、出力フィルターの複数の段階を経て行われます。同じリクエストでも、モデルによってブロック、警告、応諾と異なる扱いを受けることがあります。本記事では、GPT-5.5 Instant、Claude Sonnet 5、Grokが境界的な性的プロンプトに対してどのように応答するかを比較し、分類器のしきい値、LLMベースのフィルター、コンテキストの重要性を含むモデレーション技術を説明します。
AIサービスのコンテンツモデレーションは、プロダクトポリシー、入力分類器、出力フィルターからなるシステムを使用しています。同じセンシティブなプロンプトに対して、異なるモデルは異なる反応を示します。拒否するモデルもいれば、疑わしい点を指摘するモデルもいれば、従うモデルもいます。本記事では、GPT-5.5 Instant(ChatGPT)、Claude Sonnet 5、そしてGrokを、コミックシーンを求める性的描写の境界線上のリクエストでテストしました。テキスト作成に同意したのは1モデルだけでした。モデレーションは、脅威、ヘイト、暴力、自傷行為、性的コンテンツ、児童虐待、武器などのカテゴリーを定義するプロダクトポリシーに依存しています。入力分類器はカテゴリースコアを割り当てます。例えば、OpenAIのModeration APIは13のラベルとサブカテゴリーを返します。分類器は、偽陽性(「退屈を殺す方法」のような無害なクエリをブロックする)や偽陰性(有害なコンテンツを見逃す)を生じる可能性があります。企業はカテゴリーごとに閾値を設定します。自傷行為については高い再現率が優先され、危険度の低いカテゴリーでは適合率がより重要になる場合があります。モデレーションは、小規模なLLM(プロンプトベース)または専用の分類器で実装できます。LLMモデレーターは柔軟ですがコストが高く、プロンプトインジェクションの影響を受けやすいです。一方、専用分類器は高速ですが柔軟性に欠けます。ベストプラクティスとして、複数の検証段階を設け、スラングやタイプミスを含むテストセットを準備し、カテゴリーごとの閾値を設定し、長い対話をレビューし、設定をバージョン管理し、手動レビューのために決定をログに記録することが挙げられます。
出典: Habr — хаб ИИ —
原文
