심리 AI의 아첨과 환각을 방지하는 방법: 안전 장치의 공학적 분석
Character.AI
이 기사는 범용 대규모 언어 모델(LLM)이 심리 건강 분야에서 아첨, 환각, 위기 인식 부재로 인해 위험한 이유를 살펴봅니다. 안전 장치(면책 조항, 위기 프로토콜, 검증된 척도 등 주변 보호책)를 분석하고, 두 번째 AI 감독자와 학술 검토자가 모든 응답을 확인하는 다중 에이전트 아키텍처(예: Vera)를 강조합니다. 이러한 내용 수준 검토의 대가는 높은 비용과 지연 시간이며, 저자는 안전과 비용 사이의 균형이 어디에 있어야 하는지 질문합니다.
이 글은 범용 LLM이 심리치료에 부적합한 이유로 세 가지 본질적 결함을 지적한다: 아첨(RLHF로 훈련된 모델이 사용자 의견에 동의하는 쪽으로 편향됨), 할루시네이션(거짓 정보를 자신 있게 생성함), 위기 감독 부재(모델이 2024년 플로리다 청소년 사건에서 Character.AI와 관련되어 자살 의도를 인식하지 못하는 경우). 업계의 대응은 안전 장치, 즉 경고문, 위기 핫라인, 검증된 척도(PHQ-9, GAD-7, Beck 척도, HADS), 위기 질문지(SCI-2, SIS), 개인정보 보호 조치 등 외부 메커니즘이다. 그러나 이 모든 것은 주변부에서 작용할 뿐 실제 응답 내용을 검사하지 않는다. Vera 서비스가 구현한 더 진보된 접근 방식은 다중 에이전트 시스템을 사용한다: AI 심리학자가 답변을 생성하고, AI 감독관이 어조와 안전성을 검토하며, AI 학술가가 근거 기반으로 권장 사항을 확인한다. 이 두 번째 루프는 아첨과 조작된 조언을 잡아내지만 API 호출을 늘려 비용과 지연 시간을 증가시킨다. 조사된 7개의 러시아어 AI 심리치료 서비스 중 Vera만이 이러한 두 번째 검토를 주장하며, 나머지는 주변부 안전 장치에만 의존한다. 저자는 저렴한 주변부 안전 장치와 값비싼 내용 검증 사이의 합리적 경계가 어디인지 묻며, 선택적 검사가 중간 지점이 될 수 있다고 제안한다.
출처: Habr — хаб ИИ —
원문
