Seguridad de IAAplicaciones 🇷🇺 29.07.2026 16:01

Cómo prevenir la sicofancia y las alucinaciones en psicólogos de IA: un desglose técnico de las salvaguardas de seguridad

Character.AICharacter.AI
El artículo examina por qué los LLM de propósito general son peligrosos en funciones de salud mental debido a la sicofancia, las alucinaciones y la ceguera ante crisis. Desglosa la seguridad –obvyazka (salvaguardas perimetrales como descargos de responsabilidad, protocolos de crisis, escalas validadas) y destaca una arquitectura multiagente (por ejemplo, Vera) donde un segundo supervisor de IA y un revisor académico verifican cada respuesta. La compensación es un mayor costo y latencia por la revisión a nivel de contenido, y el autor pregunta dónde debería estar el equilibrio entre seguridad y costo.
El artículo sostiene que los LLM de propósito general no son aptos para la psicoterapia debido a tres fallos inherentes: adulación (los modelos entrenados con RLHF tienden a concordar con el usuario), alucinaciones (generación segura de hechos falsos) y supervisión de crisis (los modelos a menudo no reconocen intenciones suicidas, como en el caso de 2024 en Florida de un adolescente que involucró a Character.AI). La respuesta de la industria es la seguridad, es decir, un "encuadre" o "perímetro" (obvyazka): mecanismos externos como exenciones de responsabilidad, líneas de crisis, escalas validadas (PHQ‑9, GAD‑7, escalas de Beck, HADS), cuestionarios de crisis (SCI‑2, SIS) y medidas de privacidad. Sin embargo, todos estos actúan en el perímetro y no inspeccionan el contenido real de la respuesta. Un enfoque más avanzado, implementado por el servicio Vera, utiliza un sistema multiagente: un AI‑psicólogo genera la respuesta, un AI‑supervisor revisa el tono y la seguridad, y un AI‑académico verifica las recomendaciones contra la evidencia. Este segundo bucle detecta adulación y consejos inventados, pero multiplica las llamadas API, aumentando el costo y la latencia. Entre siete servicios de terapia AI en ruso estudiados, solo Vera afirma tener esta segunda revisión; los demás dependen únicamente de salvaguardas perimetrales. El autor pregunta dónde está el límite razonable entre un perímetro barato (obvyazka) y una verificación de contenido costosa, sugiriendo que las comprobaciones selectivas podrían ofrecer un punto intermedio.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas