AI心理学者の同調・幻覚を防ぐ方法:安全対策の工学的分解
Character.AI
本記事では、汎用大規模言語モデル(LLM)が精神保健の役割において、同調、幻覚、危機認識の欠如により危険である理由を考察する。免責事項、危機プロトコル、検証済み尺度などの安全対策(obvyazka:ペリメーターセーフガード)を分解し、第2のAIスーパーバイザーと学術レビュアーがすべての応答をチェックするマルチエージェントアーキテクチャ(例:Vera)を強調する。トレードオフはコンテンツレベルのレビューによる高いコストとレイテンシであり、著者は安全性とコストのバランスがどこにあるべきか問いかける。
この記事は、汎用LLMにはお世辞(RLHFで訓練されたモデルはユーザーに同意する傾向がある)、幻覚(虚偽の事実を自信満々に生成する)、危機の見落とし(2024年にフロリダ州でCharacter.AIが関与した10代の事件のように、自殺意図を認識できないことが多い)という3つの本質的な欠陥があり、心理療法には不適切だと論じている。業界の対応は安全性、つまり「おまじない」――免責事項、危機ホットライン、検証済み尺度(PHQ‑9、GAD‑7、ベック尺度、HADS)、危機アンケート(SCI‑2、SIS)、プライバシー対策などの外部メカニズムである。しかし、これらはすべて周辺部で作用し、実際の応答内容を検査しない。より高度なアプローチとして、Veraというサービスが実装するマルチエージェントシステムがある。AI心理士が返答を生成し、AIスーパーバイザーがトーンと安全性をレビューし、AI研究者が推奨事項を証拠に照らして確認する。この第2のループはお世辞や捏造されたアドバイスを捕捉するが、API呼び出しを増やし、コストとレイテンシを上昇させる。調査された7つのロシア語AIセラピーサービスのうち、このような第2のレビューを主張しているのはVeraのみであり、他のサービスは周辺部の安全策のみに依存している。著者は、安価な周辺部のおまじないと高価なコンテンツ検証の間で合理的な境界線がどこにあるのかを問いかけ、選択的なチェックが中間地点を提供する可能性があると示唆している。
出典: Habr — хаб ИИ —
原文
