SPEX 和 ProxySPEX:大规模识别语言模型中关键交互作用的方法
OpenAI
来自伯克利人工智能研究院的研究人员推出了 SPEX 和 ProxySPEX 算法,这些算法能够以比现有方法快数个数量级的速度,识别人工智能模型(包括大语言模型)中特征、数据和组件之间的关键交互作用。该方法基于关键交互稀疏性的思想,并运用了编码理论和信号处理技术。SPEX 的应用表明,标准的归因方法(例如 SHAP)可能会遗漏复杂的协同效应,比如在电车难题中。而利用层次结构的 ProxySPEX 则以大约十分之一的消融次数达到了相同的准确度。
来自伯克利人工智能研究院(BAIR)的研究人员开发了SPEX和ProxySPEX算法,用于识别复杂机器学习系统(包括大型语言模型)中各组件之间的有影响力的相互作用。面临的挑战在于,潜在相互作用的数量会随特征、数据点或内部组件的数量呈指数级增长,使得穷举枚举在计算上不可行。SPEX利用稀疏性和低阶假设:真正有影响力的相互作用数量很少,且仅涉及少量元素。通过策略性地选择消融实验以及编码理论中的稀疏恢复算法,SPEX能够高效地识别这些相互作用。ProxySPEX则进一步利用层次结构:如果高阶相互作用很重要,其低阶子集也很重要,从而将消融实验次数减少到SPEX的大约十分之一。在特征归因任务中,面对长上下文(数千个特征),SPEX的表现优于现有方法。例如,在一个改进版的“电车难题”中,标准的SHAP方法将GPT-4o mini的错误答案归因于“trolley”等单个单词,而SPEX则识别出“trolley”两次出现与“pulling”和“lever”之间的协同作用;将这四个词替换为同义词后,模型的错误率降至接近零。在数据归因方面,ProxySPEX成功突出了CIFAR-10上ResNet训练样本之间的协同和冗余交互。在机制可解释性(组件归因)中,该方法揭示了不同大型语言模型层中注意力头之间的相互作用方式,并在剪枝后相比其他方法提升了目标模型的性能。SPEX和ProxySPEX的代码已在SHAP-IQ代码库中提供。
来源: BAIR (Berkeley AI) —
原文
