大语言模型可解释性的新途径:权重分解,数据成本低于1%
OpenAI
Alibaba/Qwen
来自IQuest Research、Safe AI Forum、牛津大学、斯坦福大学和清华大学的研究人员提出了稀疏权重分解(SWD),这是一种通过将预训练权重矩阵分解为稀疏因子来解释大语言模型的方法,无需训练单独的替换网络。SWD使用的数据不到基于训练的基线方法(如Transcoder)的1%,可扩展到270亿参数的模型,并支持直接从权重中提取电路和进行定向编辑。
IQuest研究所与安全AI论坛、牛津大学、斯坦福大学和清华大学的合作者共同提出了一种新的方法,用于大型语言模型的机制可解释性,名为稀疏权重分解(SWD)。该方法并非训练一个独立的稀疏表示网络来近似模型的层,而是直接将密集权重矩阵分解为两个稀疏矩阵A和B,其中共享的中间维度成为可以独立评分、选择和消融的瓶颈单元。这使得研究人员能够直接从权重中提取任务回路。在单矩阵实验中,在匹配替换保真度的前提下,SWD使用的数据不到基于训练的训练类基线(如Transcoder)所需数据的1%。在GPT-2、Qwen2.5和Qwen3.5-27B上,SWD通常使用更少的瓶颈单元和活跃连接达到相同的充分性和必要性目标。该方法可扩展到27B模型,并覆盖GPT-2 Small的所有48个注意力层和MLP权重矩阵,且提供一个无需校准文本的零数据版本。论文报告称,在GPT-2 Small上,SWD仅需数千个校准token即可实现较低的交叉熵变化,而基于训练的基线则需要约10^6个token。使用SWD-FT对GPT-2 Small进行全模型替换,在连接数相同的情况下,将交叉熵从3.90降至3.44,使用了约2060万个token,而稀疏预训练基线则需28.84亿个token。对GreaterThan任务中高排名瓶颈单元的语义分析显示,六个单元中有四个对数字、年份、数量或度量有响应。针对单个单元(c205)的定向编辑实验将正确答案的对数几率边际提高了0.216,且副作用极小,表明SWD导出的方向可用于精确的行为控制。
来源: QbitAI 量子位 —
原文
