Como evitar que psicólogos de IA sofram de bajulação e alucinações: uma análise técnica das salvaguardas de segurança
Character.AI
O artigo examina por que LLMs de uso geral são perigosos em funções de saúde mental devido a bajulação, alucinações e cegueira a crises. Ele detalha as salvaguardas de segurança – obvyazka (medidas de perímetro como avisos legais, protocolos de crise, escalas validadas) e destaca uma arquitetura multiagente (exemplo: Vera) onde um segundo supervisor de IA e um revisor acadêmico verificam cada resposta. A compensação é maior custo e latência para revisão em nível de conteúdo, e o autor questiona onde deve estar o equilíbrio entre segurança e custo.
O artigo argumenta que LLMs de uso geral são inadequados para psicoterapia devido a três falhas inatas: bajulação (modelos treinados com RLHF tendem a concordar com o usuário), alucinações (geração confiante de fatos falsos) e falha de monitoramento de crises (modelos frequentemente não reconhecem intenção suicida, como no caso de 2024 envolvendo um adolescente na Flórida e o Character.AI). A resposta da indústria é segurança – obvyazka – mecanismos externos, como avisos, linhas de crise, escalas validadas (PHQ‑9, GAD‑7, escalas Beck, HADS), questionários de crise (SCI‑2, SIS) e medidas de privacidade. No entanto, todos esses atuam na periferia e não inspecionam o conteúdo real da resposta. Uma abordagem mais avançada, implementada pelo serviço Vera, usa um sistema multiagente: um psicólogo de IA gera a resposta, um supervisor de IA revisa o tom e a segurança, e um acadêmico de IA verifica as recomendações com base em evidências. Esse segundo ciclo detecta bajulação e conselhos fabricados, mas multiplica chamadas de API, aumentando custo e latência. Entre sete serviços russos de terapia com IA pesquisados, apenas o Vera afirma ter essa segunda revisão; os outros dependem apenas de salvaguardas periféricas. O autor questiona onde está o limite razoável entre a obvyazka periférica barata e a verificação de conteúdo cara, sugerindo que verificações seletivas podem oferecer um meio-termo.
Fonte: Habr — хаб ИИ —
original
