Wie Prompt-Moderation in KI-Diensten funktioniert: gut, schlecht, gesperrt
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
Die Moderation sensibler Prompts in KI-Diensten umfasst mehrere Phasen: Produktrichtlinien, Eingabeklassifikatoren und Ausgabefilter. Derselbe Antrag kann von verschiedenen Modellen unterschiedlich behandelt werden – einige blockieren, einige warnen, einige erfüllen. Der Artikel vergleicht Antworten von GPT-5.5 Instant, Claude Sonnet 5 und Grok auf einen grenzwertig erotischen Prompt und erklärt Moderationsmethoden, einschließlich Klassifikatorschwellen, LLM-basierter Filter und der Bedeutung des Kontexts.
Inhaltsmoderation bei KI-Diensten verwendet ein System aus Produktrichtlinien, Eingabeklassifikatoren und Ausgabefiltern. Verschiedene Modelle reagieren unterschiedlich auf denselben sensiblen Prompt: Eines lehnt möglicherweise ab, ein anderes weist auf fragwürdige Details hin, und ein drittes kommt der Anfrage nach. Der Artikel testete GPT-5.5 Instant (ChatGPT), Claude Sonnet 5 und Grok mit einer grenzwertig erotischen Bitte um eine Comicszene. Nur ein Modell erklärte sich bereit, den Text zu schreiben. Die Moderation stützt sich auf Produktrichtlinien, die Kategorien wie Bedrohungen, Hass, Gewalt, Selbstverletzung, sexuelle Inhalte, Kindesmissbrauch und Waffen definieren. Der Eingabeklassifikator weist Kategoriebewertungen zu – beispielsweise liefert OpenAIs Moderation API 13 Bezeichnungen mit Unterkategorien. Der Klassifikator kann falsch-positive Ergebnisse (Blockieren harmloser Anfragen wie „Langeweile töten“) oder falsch-negative Ergebnisse (Übersehen schädlicher Inhalte) produzieren. Unternehmen legen Schwellenwerte pro Kategorie fest: Bei Selbstverletzung wird hohe Erkennungsrate priorisiert; bei weniger gefährlichen Kategorien kann die Genauigkeit wichtiger sein. Die Moderation kann mit einem kleinen Sprachmodell (promptbasiert) oder einem spezialisierten Klassifikator implementiert werden. Sprachmodell-Moderatoren sind flexibel, aber kostspielig und anfällig für Prompt-Injection; spezialisierte Klassifikatoren sind schneller, aber starr. Bewährte Verfahren umfassen mehrere Verifikationsebenen, die Erstellung eines Testsatzes mit Slang und Tippfehlern, Konfiguration von kategoriespezifischen Schwellenwerten, Überprüfung langer Dialoge, Versionierung von Konfigurationen und Protokollierung von Entscheidungen für manuelle Nachprüfungen.
Quelle: Habr — хаб ИИ —
Original
