自描述作为神经网络中符号涌现的条件
Anthropic
本文探讨了自描述(报告)在符号形成中的作用——符号是神经网络中一个独立、可外部读取的单元。通过微观模型,作者表明,如果没有命名规则的要求,即使计算发生,规则也不会结晶。自描述不反映现成的知识,而是构成知识,将网络从计算器转变为原始的思维系统。该机制也解释了大模型中幻觉的产生。
作者延续了对Anthropic开启的J空间的分析,聚焦两个问题:元符号的可能性以及神经网络自我描述的本质。基于微型模型(四层)的实验表明,由于可学习性和可测量性的问题,无法获得元符号——即结合多个基本符号的符号;作者建议应在混合专家模型中寻找它。而自我描述并非一种上层结构,而是符号产生的条件:带有报告头的网络(需强制命名所应用的规则)总会结晶出一个控制轴,而无报告的网络则从不如此,且两种情况下任务解决的准确率相同。名称先于能力出现:在第一千个训练周期时,规则几乎能被完美读取,尽管主任务仅在随机水平上解决。无报告时,结构会瓦解;有报告时,结构可维持四万个周期。作者总结道:命名的要求并非标记某个现成之物,而是从计算流中切割出一个稳定的对象。报告头的预期对内容视而不见——它要求一个可展示的单元,但不验证其真实性;这既产生了符号,也产生了幻觉。关于神经网络自我建模(即报告对其自身状态的描述)的假设,因微网络的限制未能测试;间接而言,报告与实际计算之间的分歧支持了这一假设。
来源: Habr — хаб ИИ —
原文
