会“幻觉”的编译器:将程序直接编译成神经网络权重
DeepMind
研究人员正在开发一种编译器,能将人类可读的程序直接翻译成神经网络权重,从而绕过传统的训练过程。这种方法可为可解释性研究提供基准真值,因为生成的模型具有已知的内部机制。
传统编译器将高级代码转换为针对特定硬件量身定制的原始机器指令。相比之下,一种新的范式将神经网络视为目标架构:用RASP等专用语言编写的程序被直接编译成权重,无需训练即可确定性完成。RASP于2021年由Gail Weiss、Yoav Goldberg和Eran Yahav提出,提供了两个主要构造——选择和聚合,分别对应变压器的注意力和前馈机制。2023年,DeepMind实现了Tracr编译器,它接受RASP程序并输出变压器权重,使用残差流作为内存,并为变量分配不相交的块。这些编译后的模型是完全可解释的:每个变量的位置和每一层的功能都是已知的。主要动机是为可解释性研究创建基准模型,作为分析工具的校准标准。一个值得注意的发现是,与真实网络相比,Tracr的简单变量分配是浪费的,因为真实网络密集地重叠信息,这表明训练后的网络会发展出更高效但更混乱的表示。
来源: Habr — хаб ИИ —
原文
