كيف نمنع الذكاء الاصطناعي النفسي من التملق والهلوسة: تحليل هندسي لضمانات السلامة
Character.AI
تتناول المقالة لماذا تشكل نماذج اللغة الكبيرة ذات الأغراض العامة خطورة في أدوار الصحة النفسية بسبب التملق والهلوسة والعمى تجاه الأزمات. وتحلل الضمانات الطرفية مثل إخلاء المسؤولية، بروتوكولات الأزمات، والمقاييس المُتحقَّق منها، وتسلط الضوء على بنية متعددة الوكلاء (مثل Vera) حيث يقوم وكيل ذكاء اصطناعي ثانٍ ومراجع أكاديمي بمراجعة كل استجابة. والمقايضة هي التكلفة الأعلى وزمن الاستجابة الأطول للمراجعة على مستوى المحتوى، ويتساءل الكاتب أين يجب أن يكون التوازن بين السلامة والتكلفة.
تجادل المقالة بأن نماذج اللغات الكبيرة ذات الأغراض العامة غير مناسبة للعلاج النفسي بسبب ثلاثة عيوب فطرية: التملق (النماذج المدربة بتعزيز التعلم من التغذية الراجعة البشرية تميل إلى موافقة المستخدم)، والهلوسة (توليد حقائق خاطئة بثقة)، والإشراف على الأزمات (غالبًا ما تفشل النماذج في التعرف على النية الانتحارية، كما في حالة المراهق في فلوريدا عام 2024 التي تضمنت شخصية Character.AI). الاستجابة الصناعية هي السلامة – الإجراءات الوقائية – آليات خارجية مثل إخلاء المسؤولية، خطوط الأزمات الساخنة، المقاييس المُوثوقة (PHQ-9، GAD-7، مقاييس بيك، HADS)، استبيانات الأزمات (SCI-2، SIS)، وتدابير الخصوصية. ومع ذلك، تعمل كل هذه على المحيط ولا تفحص محتوى الرد الفعلي. نهج أكثر تقدمًا، تنفذه خدمة Vera، يستخدم نظامًا متعدد الوكلاء: طبيب نفسي ذكي يصوغ الرد، ومشرف ذكي يراجع النبرة والسلامة، وأكاديمي ذكي يتحقق من التوصيات مقابل الأدلة. هذه الحلقة الثانية تكتشف التملق والنصائح المُختلقة ولكنها تضاعف استدعاءات واجهة برمجة التطبيقات، مما يرفع التكلفة وزمن الاستجابة. من بين سبع خدمات علاج نفسي ذكي باللغة الروسية شملها الاستطلاع، تدّعي Vera فقط وجود هذه المراجعة الثانية؛ بينما تعتمد الخدمات الأخرى على الإجراءات الوقائية المحيطية وحدها. يتساءل المؤلف عن أين يقع الحد المعقول بين الإجراءات الوقائية المحيطية الرخيصة والتحقق الباهظ من المحتوى، مقترحًا أن الفحوص الانتقائية قد تقدم حلاً وسطًا.
المصدر: Habr — хаб ИИ —
الأصلي
