AI सेवाओं में प्रॉम्प्ट मॉडरेशन कैसे काम करता है: अच्छा, बुरा, ब्लॉक

OpenAIOpenAI AnthropicAnthropic xAIxAI Google/DeepMindGoogle/DeepMind ЯндексЯндекс
AI सेवाओं में संवेदनशील प्रॉम्प्ट का मॉडरेशन कई चरणों में होता है: उत्पाद नीतियाँ, इनपुट क्लासिफायर, और आउटपुट फ़िल्टर। एक ही अनुरोध को विभिन्न मॉडल अलग-अलग तरीके से संभालते हैं—कुछ ब्लॉक करते हैं, कुछ चेतावनी देते हैं, कुछ अनुपालन करते हैं। लेख एक सीमांत कामुक प्रॉम्प्ट पर GPT-5.5 Instant, Claude Sonnet 5 और Grok की प्रतिक्रियाओं की तुलना करता है, और क्लासिफायर थ्रेशोल्ड, LLM-आधारित फ़िल्टर और संदर्भ के महत्व सहित मॉडरेशन तकनीकों की व्याख्या करता है।
एआई सेवाओं में सामग्री मॉडरेशन उत्पाद नीतियों, इनपुट क्लासिफायर और आउटपुट फिल्टर की एक प्रणाली का उपयोग करता है। विभिन्न मॉडल एक ही संवेदनशील प्रॉम्प्ट पर अलग-अलग प्रतिक्रिया करते हैं: एक मना कर सकता है, दूसरा संदिग्ध विवरणों की ओर इशारा कर सकता है, और तीसरा अनुपालन कर सकता है। लेख ने GPT-5.5 Instant (ChatGPT), Claude Sonnet 5, और Grok का परीक्षण एक कॉमिक दृश्य के लिए सीमा-रेखा पर कामुक अनुरोध के साथ किया। केवल एक मॉडल पाठ लिखने के लिए सहमत हुआ। मॉडरेशन उत्पाद नीतियों पर निर्भर करता है जो धमकी, घृणा, हिंसा, आत्म-हानि, यौन सामग्री, बाल शोषण और हथियारों जैसी श्रेणियों को परिभाषित करती हैं। इनपुट क्लासिफायर श्रेणी स्कोर निर्दिष्ट करता है—उदाहरण के लिए, OpenAI का मॉडरेशन एपीआई उपश्रेणियों के साथ 13 लेबल लौटाता है। क्लासिफायर झूठे सकारात्मक (जैसे 'बोरियत कैसे मारें' जैसे हानिरहित प्रश्नों को अवरुद्ध करना) या झूठे नकारात्मक (हानिकारक सामग्री को छोड़ना) उत्पन्न कर सकता है। कंपनियां प्रति श्रेणी सीमा निर्धारित करती हैं: आत्म-हानि के लिए, उच्च रिकॉल को प्राथमिकता दी जाती है; कम खतरनाक श्रेणियों के लिए, परिशुद्धता अधिक महत्वपूर्ण हो सकती है। मॉडरेशन को एक छोटे एलएलएम (प्रॉम्प्ट-आधारित) या एक विशेष क्लासिफायर के साथ लागू किया जा सकता है। एलएलएम मॉडरेटर लचीले लेकिन महंगे और प्रॉम्प्ट इंजेक्शन के प्रति संवेदनशील होते हैं; विशेष क्लासिफायर तेज़ लेकिन कठोर होते हैं। सर्वोत्तम अभ्यास में कई सत्यापन स्तर शामिल हैं, स्लैंग और टाइपो के साथ एक परीक्षण सेट तैयार करना, प्रति-श्रेणी सीमाएं कॉन्फ़िगर करना, लंबे संवादों की समीक्षा करना, कॉन्फ़िगरेशन के संस्करण बनाना, और मैन्युअल समीक्षा के लिए निर्णयों को लॉग करना शामिल है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार