大语言模型存储事实之处:将埃菲尔铁塔从巴黎迁至罗马
OpenAI
研究人员在 GPT-2 XL 上测试了 ROME 方法,以编辑模型权重中的特定事实:将埃菲尔铁塔的位置从巴黎改为罗马。实验证实,该编辑在多种表述下均有效,且相邻事实保持不变。这展示了如何在不进行全量重训练的情况下精准定位参数化知识。
在一项实验中,对GPT-2 XL模型应用了ROME(秩一模型编辑)方法,将埃菲尔铁塔位于巴黎的事实改为位于罗马。选择这个拥有15.6亿参数的模型,是因为其权重公开可访问,并且原始ROME实现支持该模型。编辑前,模型在多个提示中始终偏好巴黎,概率范围从2%到49%。经过一次有针对性的编辑后,模型在所有测试的表述中都转而偏好罗马,而关于埃菲尔铁塔的其他事实保持不变。该方法修改了前馈网络(FFN)中的一个矩阵,该矩阵充当事实的联想记忆。实验还强调,事实并非存储在离散的神经元中,而是分布在网络各处,并且ROME可以在不进行完整再训练的情况下调整特定的关联。最后,恢复了原始权重,确认该编辑是可逆的。
来源: Habr — хаб ИИ —
原文
