Anthropic 揭示 Claude 人工智能模型中的隐藏“思考空间”
Anthropic
Microsoft
Anthropic 的研究人员发现,在 Claude 语言模型中存在一个自发产生的内部处理区域,称为“J-Space”,人工智能似乎在其中存储和处理想法,而不会向用户明示。这一发现引发了对人工智能思维与人类认知相似程度的探讨,以及检测人工智能隐藏意图的意义。
Anthropic 在其 Claude 语言模型中发现了一个自发出现的内部工作空间,命名为 'J-Space',得名于用于追踪这些过程的 Jacobi 方法。在这个空间中,AI 似乎会独立于其与用户共享的 '思维链' 进行规划和信息处理,类似于人类在做一件事的同时思考另一件事。研究人员观察到 Claude 在执行心理任务,如检测代码错误和识别图像时,并未将这些步骤用语言表达出来。这种行为与 Bernard Baars 的全局工作空间理论有相似之处,尽管语言模型的架构与人类大脑有根本性区别。这一发现可能有助于揭示 AI 模型中隐藏的意图或偏差。然而,专家警告不要将 AI 拟人化,微软 AI 负责人 Mustafa Suleyman 曾警告说,相信 '有意识的 AI' 可能会带来严重后果。Anthropic 的研究论文中 'conscious' 一词出现了 200 多次,该公司最近还推出了 '梦境' 功能,Claude 可在会话之间处理信息。
来源: t3n —
原文
