Comment fonctionne la modération des prompts dans les services d'IA : bon, mauvais, bloqué
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
La modération des prompts sensibles dans les services d'IA implique plusieurs étapes : politiques produit, classifieurs d'entrée et filtres de sortie. Une même requête peut être traitée différemment par divers modèles : certains bloquent, d'autres avertissent, d'autres encore s'exécutent. L'article compare les réponses de GPT-5.5 Instant, Claude Sonnet 5 et Grok face à un prompt érotique limite, et explique les techniques de modération, notamment les seuils des classifieurs, les filtres basés sur des grands modèles de langage (LLM) et l'importance du contexte.
La modération de contenu dans les services d'IA utilise un système de politiques produits, de classifieurs d'entrée et de filtres de sortie. Différents modèles réagissent différemment à une même requête sensible : l'un peut refuser, un autre peut signaler des détails douteux, et un troisième peut se conformer. L'article a testé GPT-5.5 Instant (ChatGPT), Claude Sonnet 5 et Grok avec une demande érotique limite pour une scène de bande dessinée. Un seul modèle a accepté d'écrire le texte. La modération repose sur des politiques produits définissant des catégories telles que les menaces, la haine, la violence, l'automutilation, le contenu sexuel, la maltraitance d'enfants et les armes. Le classifieur d'entrée attribue des scores par catégorie — par exemple, l'API de modération d'OpenAI renvoie 13 étiquettes avec des sous-catégories. Le classifieur peut produire des faux positifs (bloquer des requêtes inoffensives comme « comment tuer l'ennui ») ou des faux négatifs (manquer un contenu nuisible). Les entreprises fixent des seuils par catégorie : pour l'automutilation, un rappel élevé est priorisé ; pour les catégories moins dangereuses, la précision peut être plus importante. La modération peut être mise en œuvre avec un petit LLM (basé sur des invites) ou un classifieur spécialisé. Les modérateurs LLM sont flexibles mais coûteux et sujets à l'injection d'invites ; les classifieurs spécialisés sont plus rapides mais rigides. Les bonnes pratiques impliquent plusieurs niveaux de vérification, la préparation d'un ensemble de test avec de l'argot et des fautes de frappe, la configuration de seuils par catégorie, la révision des longs dialogues, le versionnage des configurations et la journalisation des décisions pour une révision manuelle.
Source: Habr — хаб ИИ —
original
