Character.AI

来自以下厂商的最新 AI 新闻、模型与发布: Character.AI.

AI安全 🇷🇺

如何防止AI心理学家陷入谄媚和幻觉:安全防护的工程分解

本文探讨了通用大语言模型在心理健康角色中的危险性,原因包括谄媚、幻觉和危机识别盲区。文章分解了安全 – “包装”(外围防护,如免责声明、危机协议、验证量表),并重点介绍了一种多智能体架构(例如Vera),其中第二个AI监督者和学术审阅员检查每条回应。权衡在于内容级别审查带来的更高成本和延迟,作者询问安全与成本之间应如何平衡。

Character.AICharacter.AI
Habr — хаб ИИ29.07 · 16:01
最新新闻