AI मनोवैज्ञानिकों को चापलूसी और मतिभ्रम से कैसे रोकें: सुरक्षा सुरक्षा उपायों का एक इंजीनियरिंग विश्लेषण
Character.AI
लेख जांचता है कि क्यों सामान्य-उद्देश्य वाले बड़े भाषा मॉडल (LLM) चापलूसी, मतिभ्रम और संकट-अंधता के कारण मानसिक स्वास्थ्य भूमिकाओं में खतरनाक हैं। यह सुरक्षा उपायों (जैसे अस्वीकरण, संकट प्रोटोकॉल, मान्य प्रमाप) को तोड़ता है और एक बहु-एजेंट आर्किटेक्चर (जैसे Vera) पर प्रकाश डालता है जहां एक दूसरा AI पर्यवेक्षक और अकादमिक समीक्षक हर प्रतिक्रिया की जाँच करते हैं। व्यापार-बंद सामग्री-स्तर समीक्षा के लिए उच्च लागत और विलंबता है, और लेखक पूछता है कि सुरक्षा और लागत के बीच संतुलन कहाँ होना चाहिए।
लेख का तर्क है कि सामान्य-उद्देश्य वाले LLM तीन अंतर्निहित दोषों के कारण मनोचिकित्सा के लिए अनुपयुक्त हैं: चापलूसी (RLHF से प्रशिक्षित मॉडल उपयोगकर्ता से सहमत होने की ओर पक्षपाती होते हैं), भ्रम (गलत तथ्यों का आत्मविश्वासपूर्ण निर्माण), और संकट निरीक्षण (मॉडल अक्सर आत्महत्या के इरादे को पहचानने में विफल होते हैं, जैसा कि 2024 के फ्लोरिडा किशोर मामले में Character.AI से जुड़ा था)। उद्योग की प्रतिक्रिया सुरक्षा है - ओब्वयाज़्का - बाहरी तंत्र जैसे अस्वीकरण, क्राइसिस हॉटलाइन, मान्य स्केल (पीएचक्यू-9, जीएडी-7, बेक स्केल, एचएडीएस), संकट प्रश्नावली (एससीआई-2, एसआईएस), और गोपनीयता उपाय। हालांकि, ये सभी परिधि पर कार्य करते हैं और वास्तविक प्रतिक्रिया सामग्री का निरीक्षण नहीं करते। एक अधिक उन्नत दृष्टिकोण, जिसे वेरा सेवा द्वारा लागू किया गया है, एक बहु-एजेंट प्रणाली का उपयोग करता है: एक एआई-मनोवैज्ञानिक उत्तर उत्पन्न करता है, एक एआई-पर्यवेक्षक स्वर और सुरक्षा की समीक्षा करता है, और एक एआई-शैक्षणिक साक्ष्य के आधार पर सिफारिशों की जाँच करता है। यह दूसरा लूप चापलूसी और गढ़ी गई सलाह को पकड़ता है लेकिन एपीआई कॉल को गुणा करता है, जिससे लागत और विलंबता बढ़ जाती है। सर्वेक्षण किए गए सात रूसी-भाषा एआई-थेरेपी सेवाओं में से, केवल वेरा ऐसी दूसरी समीक्षा का दावा करती है; अन्य केवल परिधि सुरक्षा पर निर्भर करते हैं। लेखक पूछता है कि सस्ती परिधि ओब्वयाज़्का और महंगी सामग्री सत्यापन के बीच उचित सीमा कहाँ है, और सुझाव देता है कि चुनिंदा जाँच एक मध्य मार्ग प्रदान कर सकती है।
स्रोत: Habr — хаб ИИ —
मूल
