كيف نمنع انحياز الملقنين والهلوسة لدى علماء النفس من الذكاء الاصطناعي: تحليل هندسي لضمانات السلامة

Character.AICharacter.AI
تتناول المقالة لماذا تُعتبر نماذج اللغة العامة خطيرة في أدوار الصحة النفسية بسبب انحياز الملقنين والهلوسة والعمى تجاه الأزمات. تقوم بتفصيل ضمانات السلامة - مثل التنبيهات والبروتوكولات الخاصة بالأزمات والمقاييس المُتحقق منها - وتسلط الضوء على بنية متعددة الوكلاء (مثل Vera) حيث يقوم وكيل ذكاء اصطناعي ثانٍ ومراجع أكاديمي بفحص كل استجابة. المفاضلة هي التكلفة العالية وزمن الاستجابة الطويل للمراجعة على مستوى المحتوى، ويسأل الكاتب أين يجب أن يكون التوازن بين السلامة والتكلفة.
تجادل المقالة بأن نماذج اللغات الكبيرة ذات الأغراض العامة غير مناسبة للعلاج النفسي بسبب ثلاثة عيوب فطرية: التملق (النماذج المدربة بتعزيز التعلم من التغذية الراجعة البشرية تميل إلى موافقة المستخدم)، والهلوسة (توليد حقائق خاطئة بثقة)، والإشراف على الأزمات (غالبًا ما تفشل النماذج في التعرف على النية الانتحارية، كما في حالة المراهق في فلوريدا عام 2024 التي تضمنت شخصية Character.AI). الاستجابة الصناعية هي السلامة – الإجراءات الوقائية – آليات خارجية مثل إخلاء المسؤولية، خطوط الأزمات الساخنة، المقاييس المُوثوقة (PHQ-9، GAD-7، مقاييس بيك، HADS)، استبيانات الأزمات (SCI-2، SIS)، وتدابير الخصوصية. ومع ذلك، تعمل كل هذه على المحيط ولا تفحص محتوى الرد الفعلي. نهج أكثر تقدمًا، تنفذه خدمة Vera، يستخدم نظامًا متعدد الوكلاء: طبيب نفسي ذكي يصوغ الرد، ومشرف ذكي يراجع النبرة والسلامة، وأكاديمي ذكي يتحقق من التوصيات مقابل الأدلة. هذه الحلقة الثانية تكتشف التملق والنصائح المُختلقة ولكنها تضاعف استدعاءات واجهة برمجة التطبيقات، مما يرفع التكلفة وزمن الاستجابة. من بين سبع خدمات علاج نفسي ذكي باللغة الروسية شملها الاستطلاع، تدّعي Vera فقط وجود هذه المراجعة الثانية؛ بينما تعتمد الخدمات الأخرى على الإجراءات الوقائية المحيطية وحدها. يتساءل المؤلف عن أين يقع الحد المعقول بين الإجراءات الوقائية المحيطية الرخيصة والتحقق الباهظ من المحتوى، مقترحًا أن الفحوص الانتقائية قد تقدم حلاً وسطًا.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة