Как предотвратить сикофантию и галлюцинации у ИИ-психологов: инженерный анализ мер безопасности
Character.AI
В статье рассматривается, почему языковые модели общего назначения опасны в роли ментальных консультантов из-за сикофантии, галлюцинаций и неспособности распознать кризис. Описаны меры защиты – обвязка (периметральные ограничения, такие как дисклеймеры, кризисные протоколы, валидированные шкалы) и выделена мультиагентная архитектура (например, Vera), где второй супервизор-ИИ и академический рецензент проверяют каждый ответ. Компромисс – более высокая стоимость и задержка при проверке содержания, и автор задаётся вопросом, где должен быть баланс между безопасностью и стоимостью.
В статье утверждается, что LLM общего назначения непригодны для психотерапии из-за трёх врождённых недостатков: угодничество (модели, обученные с помощью обучения с подкреплением на основе обратной связи от человека, склонны соглашаться с пользователем), галлюцинации (уверенная генерация ложных фактов) и недостаточный контроль кризисных ситуаций (модели часто не распознают суицидальные намерения,
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
