研究モデル 🇨🇳 15.08.2026 11:03

LLM可解释性新路径:权重分解,数据成本不到1%

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
来自IQuest Research、Safe AI Forum、牛津大学、斯坦福大学和清华大学的研究人员提出了稀疏权重分解(SWD)方法,通过将预训练权重矩阵分解为稀疏因子来解释大型语言模型,无需训练单独的重置网络。SWD使用的数据不到基于训练基线(如Transcoder)所需数据的1%,可扩展至270亿参数模型,并支持直接从权重中提取电路和进行目标编辑。
アイクエスト研究所は、Safe AI Forum、オックスフォード大学、スタンフォード大学、清華大学の共同研究者らとともに、大規模言語モデルのメカニスティック解釈可能性に対する新しいアプローチであるスパース重み分解(SWD)を提案する。モデルの層を近似するために別のスパース表現ネットワークを訓練する代わりに、SWDは密な重み行列を2つのスパース行列AとBに直接分解し、共有される中間次元がボトルネック単位となり、独立してスコアリング、選択、除去が可能である。これにより、研究者は重みから直接タスク回路を抽出できる。置換忠実度を一致させる単一行列実験では、SWDはTranscoderのような訓練ベースのベースラインが必要とするデータの1%未満を使用する。GPT-2、Qwen2.5、Qwen3.5-27Bでは、SWDは通常、少ないボトルネック単位とアクティブ接続で同じ十分性と必要性のターゲットを達成する。この方法は27Bモデルにスケールし、GPT-2 Smallの48個すべてのアテンションとMLP重み行列をカバーし、キャリブレーションテキストを必要としないゼロデータバージョンもある。論文では、GPT-2 Smallにおいて、SWDは数千のキャリブレーショントークンで低いCEデルタを達成するのに対し、訓練ベースのベースラインは約10^6トークンを必要とすると報告されている。SWD-FTを用いたGPT-2 Smallの完全モデル置換では、同じ数の接続でCEを3.90から3.44に削減し、約2060万トークンを使用する(スパース事前学習ベースラインの28億8400万トークンと比較して)。GreaterThanタスクでの高ランクのボトルネック単位の意味分析では、6つの単位のうち4つが数字、年、数量、または測定値に応答することが示された。単一の単位(c205)に対するターゲット編集実験では、正解のロジットマージンが0.216増加し、副作用は最小限であり、SWDから導出された方向が精密な行動制御に使用できることを実証している。
出典: QbitAI 量子位 — 原文
関連記事 ↓
新着ニュース