Hoe promptmoderatie werkt bij AI-diensten: goed, fout, geblokkeerd
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
Moderatie van gevoelige prompts in AI-diensten omvat meerdere fasen: productbeleid, invoerclassificatoren en uitvoerfilters. Hetzelfde verzoek kan door verschillende modellen anders worden behandeld: sommige blokkeren, sommige waarschuwen, sommige geven gehoor. Het artikel vergelijkt reacties van GPT-5.5 Instant, Claude Sonnet 5 en Grok op een grensoverschrijdende erotische prompt en legt moderatietechnieken uit, waaronder classificatordrempels, op LLM gebaseerde filters en het belang van context.
Contentmoderatie in AI-diensten maakt gebruik van een systeem van productbeleid, inputclassificaties en outputfilters. Verschillende modellen reageren anders op dezelfde gevoelige prompt: de ene weigert, een ander wijst op twijfelachtige details en een derde voldoet eraan. Het artikel testte GPT-5.5 Instant (ChatGPT), Claude Sonnet 5 en Grok met een grensoverschrijdend erotisch verzoek voor een stripfiguur. Slechts één model stemde ermee in de tekst te schrijven. Moderatie is gebaseerd op productbeleid dat categorieën definieert zoals bedreigingen, haat, geweld, zelfbeschadiging, seksuele inhoud, misbruik van kinderen en wapens. De inputclassifier kent categoriscores toe – bijvoorbeeld de Moderation API van OpenAI retourneert 13 labels met subcategorieën. De classifier kan vals-positieven produceren (het blokkeren van onschuldige queries zoals 'hoe verveel ik me te pletter') of vals-negatieven (het missen van schadelijke inhoud). Bedrijven stellen drempelwaarden per categorie in: voor zelfbeschadiging wordt hoge recall geprioriteerd; voor minder gevaarlijke categorieën kan precisie belangrijker zijn. Moderatie kan worden geïmplementeerd met een kleine LLM (Large Language Model) (promptgebaseerd) of een gespecialiseerde classifier. LLM-moderators zijn flexibel maar kostbaar en vatbaar voor prompt-injectie; gespecialiseerde classifiers zijn sneller maar star. Best practice omvat meerdere verificatieniveaus, het voorbereiden van een testset met straattaal en typefouten, het configureren van drempels per categorie, het beoordelen van lange dialogen, het versioneren van configuraties en het loggen van beslissingen voor handmatige beoordeling.
Bron: Habr — хаб ИИ —
origineel
