研究 🇷🇺 24.07.2026 19:02

语言模型中的全局工作空间发现:以Claude为例

AnthropicAnthropic
Anthropic的研究人员在语言模型Claude中发现了一组特定的内部神经模式——J空间,它充当了意识访问思想的“工作空间”。这个空间并非人为编程,而是在训练过程中自然涌现。J空间使模型能够报告其内部表示、按需调节这些表示,并将其用于内部推理,这类似于神经科学中的全局工作空间理论。
在Anthropic发表的一篇文章中,研究人员展示了证据,表明在当代语言模型(尤其是Claude)中,形成了一小组内部神经模式,称为J-空间。这些模式是通过雅可比透镜(J-透镜,即雅可比矩阵的透镜)方法发现的,该方法能够识别出增加未来某个词出现概率的内部活动。J-空间具有独特性质:Claude能够报告其中包含的表征,根据请求对其进行调制,将其用于内部多步骤推理,并灵活地将同一表征应用于不同任务。同时,J-空间不参与大多数自动过程,如流利说话或语法处理;关闭它不会破坏模型的基本功能,但会使模型失去高阶认知能力。实验表明,J-空间与神经网络的其余部分有强连接,使其能够充当“全局工作空间”,类似于神经生物学中的意识通达理论。研究人员指出,这些发现并不表明Claude具有意识,但提供了一个实用工具来观察其内部思维,例如检测欺骗尝试或隐藏目标。该文章附有科学出版物、开源代码和交互式演示。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻