LLM 해석 가능성의 새로운 경로: 데이터 비용 1% 미만의 가중치 분해
OpenAI
Alibaba/Qwen
IQuest Research, Safe AI Forum, 옥스퍼드, 스탠포드, 칭화대 연구진이 희소 가중치 분해(Sparse Weight Decomposition, SWD)를 제안했습니다. 이는 사전 학습된 가중치 행렬을 희소 요인으로 분해하여 대규모 언어 모델을 해석하는 방법으로, 별도의 대체 네트워크를 훈련할 필요가 없습니다. SWD는 Transcoder와 같은 훈련 기반 기준선이 필요로 하는 데이터의 1% 미만을 사용하며, 27B 규모의 모델로 확장 가능하고, 가중치에서 직접 회로 추출 및 표적 편집을 가능하게 합니다.
IQuest Research Institute는 Safe AI Forum, 옥스퍼드 대학교, 스탠퍼드 대학교, 칭화대학교의 연구자들과 함께 대규모 언어 모델의 메커니즘 해석 가능성(mechanistic interpretability)을 위한 새로운 접근법인 희소 가중치 분해(Sparse Weight Decomposition, SWD)를 제안한다. SWD는 모델의 계층을 근사하기 위해 별도의 희소 표현 네트워크를 훈련하는 대신, 밀집 가중치 행렬을 두 개의 희소 행렬 A와 B로 직접 분해한다. 여기서 공유되는 중간 차원은 병목 유닛(bottleneck unit)이 되어 독립적으로 점수를 매기고, 선택하고, 절제(ablation)할 수 있다. 이를 통해 연구자들은 가중치에서 직접 작업 회로(task circuit)를 추출할 수 있다. 대체 충실도(replacement fidelity)를 맞춘 단일 행렬 실험에서 SWD는 Transcoder와 같은 훈련 기반 기준선에 필요한 데이터의 1% 미만을 사용한다. GPT-2, Qwen2.5, Qwen3.5-27B에서 SWD는 일반적으로 더 적은 병목 유닛과 활성 연결로 동일한 충분성(sufficiency) 및 필요성(necessity) 목표를 달성한다. 이 방법은 27B 모델까지 확장되며 GPT-2 Small의 48개 주의(attention) 및 MLP 가중치 행렬을 모두 포함하고, 보정 텍스트가 필요 없는 제로 데이터 버전도 제공한다. 논문은 GPT-2 Small에서 SWD가 수천 개의 보정 토큰만으로 낮은 교차 엔트로피(CE) 델타를 달성하는 반면, 훈련 기반 기준선은 약 10^6 토큰이 필요하다고 보고한다. SWD-FT를 사용한 GPT-2 Small의 전체 모델 대체는 동일한 연결 수로 CE를 3.90에서 3.44로 줄이며, 희소 사전 훈련 기준선의 2.884억 토큰과 비교해 약 2060만 토큰을 사용한다. GreaterThan 작업에서 높은 순위의 병목 유닛에 대한 의미 분석 결과, 6개 유닛 중 4개가 숫자, 연도, 수량 또는 측정값에 반응한다. 단일 유닛(c205)에 대한 표적 편집 실험은 최소한의 부작용으로 정답에 대한 로짓 마진을 0.216만큼 증가시켜, SWD에서 도출된 방향이 정밀한 행동 제어에 사용될 수 있음을 보여준다.
출처: QbitAI 量子位 —
원문
