SPEXとProxySPEX:大規模LLMにおける影響力のある相互作用を特定する手法
OpenAI
BAIR(バークレー人工知能研究所)の研究者らは、SPEXとProxySPEXを発表しました。これらのアルゴリズムは、特徴、データ、AIモデル(LLMを含む)のコンポーネント間の重要な相互作用を、既存の手法よりも桁違いに高速に特定できます。これらの手法は、影響力のある相互作用がスパースであるという考えに基づき、符号理論と信号処理の技術を利用しています。SPEXの適用により、標準的な帰属手法(例:SHAP)では、トロッコ問題の場合のように複雑な相乗効果を見落とす可能性があることが示されました。階層性の性質を活用するProxySPEXは、約10分の1のアブレーションで同じ精度を達成します。
BAIR(バークレー人工知能研究所)の研究者らは、大規模言語モデル(LLM)を含む複雑な機械学習システムの構成要素間の影響力のある相互作用を特定するためのアルゴリズム、SPEXとProxySPEXを開発しました。課題は、潜在的な相互作用の数が特徴量、データポイント、または内部コンポーネントの数に対して指数関数的に増加し、網羅的な列挙が計算的に不可能になることです。SPEXは、スパース性と低次元仮定を活用します。つまり、真に影響力のある相互作用の数は少なく、それらは要素の小さなサブセットのみを含むというものです。戦略的に選択されたアブレーションと符号理論に基づくスパース回帰アルゴリズムを用いることで、SPEXはこれらの相互作用を効率的に特定します。ProxySPEXはさらに階層性を利用します。高次の相互作用が重要であれば、その低次の部分集合も重要であるため、SPEXと比較してアブレーションの数を約10分の1に削減します。特徴量帰属タスクでは、SPEXは長いコンテキスト(数千の特徴量)において既存の手法を上回りました。例えば、修正版「トロッコ問題」では、標準的なSHAP法はGPT-4o miniの誤った回答を「trolley」のような個々の単語に帰属させたのに対し、SPEXは2つの「trolley」と「pulling」「lever」の間の相乗効果を特定し、これら4単語を同義語に置き換えることでモデルのエラー率をほぼゼロに削減しました。データ帰属では、ProxySPEXはCIFAR-10上のResNetにおいて、学習サンプル間の相乗的および冗長的な相互作用を強調することに成功しました。メカニスティック解釈可能性(コンポーネント帰属)では、この手法は異なるLLM層の注意ヘッドがどのように相互作用するかを明らかにし、プルーニング後のターゲットモデルの性能を他の手法と比較して向上させました。SPEXとProxySPEXのコードはSHAP-IQリポジトリで利用可能です。
出典: BAIR (Berkeley AI) —
原文
