AI सेवाओं में प्रॉम्प्ट मॉडरेशन कैसे काम करता है: अच्छा, बुरा, ब्लॉक
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
AI सेवाओं में संवेदनशील प्रॉम्प्ट का मॉडरेशन कई चरणों में होता है: उत्पाद नीतियाँ, इनपुट क्लासिफायर, और आउटपुट फ़िल्टर। एक ही अनुरोध को विभिन्न मॉडल अलग-अलग तरीके से संभालते हैं—कुछ ब्लॉक करते हैं, कुछ चेतावनी देते हैं, कुछ अनुपालन करते हैं। लेख एक सीमांत कामुक प्रॉम्प्ट पर GPT-5.5 Instant, Claude Sonnet 5 और Grok की प्रतिक्रियाओं की तुलना करता है, और क्लासिफायर थ्रेशोल्ड, LLM-आधारित फ़िल्टर और संदर्भ के महत्व सहित मॉडरेशन तकनीकों की व्याख्या करता है।
एआई सेवाओं में सामग्री मॉडरेशन उत्पाद नीतियों, इनपुट क्लासिफायर और आउटपुट फिल्टर की एक प्रणाली का उपयोग करता है। विभिन्न मॉडल एक ही संवेदनशील प्रॉम्प्ट पर अलग-अलग प्रतिक्रिया करते हैं: एक मना कर सकता है, दूसरा संदिग्ध विवरणों की ओर इशारा कर सकता है, और तीसरा अनुपालन कर सकता है। लेख ने GPT-5.5 Instant (ChatGPT), Claude Sonnet 5, और Grok का परीक्षण एक कॉमिक दृश्य के लिए सीमा-रेखा पर कामुक अनुरोध के साथ किया। केवल एक मॉडल पाठ लिखने के लिए सहमत हुआ। मॉडरेशन उत्पाद नीतियों पर निर्भर करता है जो धमकी, घृणा, हिंसा, आत्म-हानि, यौन सामग्री, बाल शोषण और हथियारों जैसी श्रेणियों को परिभाषित करती हैं। इनपुट क्लासिफायर श्रेणी स्कोर निर्दिष्ट करता है—उदाहरण के लिए, OpenAI का मॉडरेशन एपीआई उपश्रेणियों के साथ 13 लेबल लौटाता है। क्लासिफायर झूठे सकारात्मक (जैसे 'बोरियत कैसे मारें' जैसे हानिरहित प्रश्नों को अवरुद्ध करना) या झूठे नकारात्मक (हानिकारक सामग्री को छोड़ना) उत्पन्न कर सकता है। कंपनियां प्रति श्रेणी सीमा निर्धारित करती हैं: आत्म-हानि के लिए, उच्च रिकॉल को प्राथमिकता दी जाती है; कम खतरनाक श्रेणियों के लिए, परिशुद्धता अधिक महत्वपूर्ण हो सकती है। मॉडरेशन को एक छोटे एलएलएम (प्रॉम्प्ट-आधारित) या एक विशेष क्लासिफायर के साथ लागू किया जा सकता है। एलएलएम मॉडरेटर लचीले लेकिन महंगे और प्रॉम्प्ट इंजेक्शन के प्रति संवेदनशील होते हैं; विशेष क्लासिफायर तेज़ लेकिन कठोर होते हैं। सर्वोत्तम अभ्यास में कई सत्यापन स्तर शामिल हैं, स्लैंग और टाइपो के साथ एक परीक्षण सेट तैयार करना, प्रति-श्रेणी सीमाएं कॉन्फ़िगर करना, लंबे संवादों की समीक्षा करना, कॉन्फ़िगरेशन के संस्करण बनाना, और मैन्युअल समीक्षा के लिए निर्णयों को लॉग करना शामिल है।
स्रोत: Habr — хаб ИИ —
मूल
