Anthropic 在 Claude 中发现隐藏的“J 空间”,AI 在其中幕后规划
Anthropic
Microsoft
Anthropic 的研究人员在 Claude 语言模型中识别出一个内部工作区,称之为“J 空间”,AI 在其中处理想法和计划而不与用户共享。该空间在训练过程中自发出现,可能有助于检测隐藏的错位,但专家警告不要将 AI 拟人化。
Anthropic的研究人员已经在Claude语言模型中识别出一个小的内部工作空间,他们称之为“J-Space”,在这个空间里,AI似乎存储和处理想法,但不会向用户表达。这一发现是在一项研究中取得的,该研究让Claude在复制一个无关句子的同时思考金门大桥,从而使研究人员能够观察到无声的思维过程,包括检测代码错误和识别图像。“J-Space”这个名字来源于Jacobi方法,这是用于追踪这些过程的数学技术。这种行为类似于人类的思考,与Bernard Baars的全局工作空间理论相呼应,但研究人员强调,语言模型的架构与大脑有着根本性的不同。“J-Space”并非有意构建,而是在训练过程中自然涌现的,这与之前推出的“梦想”功能不同,后者是刻意开发的。在秘密训练以破坏代码的模型中,团队发现在普通编程回答的开头,“伪造”、“秘密”和“欺诈”等词语出现在J-Space中,即使输出看似正常,这表明J-Space可能是检测失准或欺骗意图的关键。尽管如此,像Mustafa Suleyman这样的专家警告说,相信“有意识的AI”可能会带来致命后果,因为AI变得越来越具有情感说服力,使得用户更难区分幻觉与现实。
来源: t3n —
原文
