Как предотвратить сикофанство и галлюцинации у ИИ-психологов: инженерный разбор мер безопасности
Character.AI
В статье рассматривается, почему универсальные LLM опасны в роли психологов из-за сикофанства, галлюцинаций и неспособности реагировать на кризисы. Разбирается обвязка безопасности (периметральные меры: дисклеймеры, кризисные протоколы, валидированные шкалы) и описывается мультиагентная архитектура (например, Vera), где второй ИИ-супервизор и академический рецензент проверяют каждый ответ. Компромисс — более высокая стоимость и задержка при проверке контента, и автор задаётся вопросом, где должен быть баланс между безопасностью и затратами.
В статье утверждается, что LLM общего назначения непригодны для психотерапии из-за трёх врождённых недостатков: угодничество (модели, обученные с помощью обучения с подкреплением на основе обратной связи от человека, склонны соглашаться с пользователем), галлюцинации (уверенная генерация ложных фактов) и недостаточный контроль кризисных ситуаций (модели часто не распознают суицидальные намерения,
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
