SPEX 및 ProxySPEX: LLM에서 영향력 있는 상호작용을 대규모로 식별하는 방법
OpenAI
BAIR(Berkeley AI)의 연구진이 SPEX 및 ProxySPEX 알고리즘을 소개했습니다. 이 알고리즘은 기존 방법보다 수 배 더 빠르게 AI 모델(LLM 포함)의 특징, 데이터 및 구성 요소 간의 중요한 상호작용을 식별할 수 있습니다. 이 방법은 영향력 있는 상호작용의 희소성 아이디어에 기반하며, 코딩 이론과 신호 처리 기술을 활용합니다. SPEX를 적용한 결과, 표준 속성 기여도 방법(예: SHAP)은 트롤리 문제의 경우와 같이 복잡한 시너지를 놓칠 수 있음을 보여주었습니다. 계층 구조 속성을 활용하는 ProxySPEX는 약 10배 적은 제거 실험으로 동일한 정확도를 달성합니다.
BAIR(버클리 인공지능 연구소)의 연구진이 대규모 언어 모델(LLM)을 포함한 복잡한 기계 학습 시스템의 구성 요소 간 영향력 있는 상호작용을 식별하는 알고리즘 SPEX와 ProxySPEX를 개발했습니다. 문제는 잠재적 상호작용의 수가 특징, 데이터 포인트 또는 내부 구성 요소의 수에 따라 기하급수적으로 증가하여 완전 열거가 계산적으로 불가능하다는 점입니다. SPEX는 희소성(sparsity)과 저차수(low-degree) 가정을 활용합니다. 즉, 실제로 영향력 있는 상호작용의 수는 적고, 이들은 소수의 요소만 포함합니다. 전략적으로 선택된 절제(ablations)와 부호 이론(coding theory)의 희소 복원 알고리즘을 사용하여 SPEX는 이러한 상호작용을 효율적으로 식별합니다. ProxySPEX는 계층 구조(hierarchy)를 추가로 활용합니다. 고차 상호작용이 중요하면 그 하위 차수 부분 집합도 중요하므로, SPEX에 비해 절제 횟수를 약 10분의 1로 줄입니다. 특징 기여도(feature attribution) 작업에서 SPEX는 긴 맥락(수천 개의 특징)에서 기존 방법을 능가했습니다. 예를 들어, 변형된 '트롤리 딜레마'에서 표준 SHAP 방법은 GPT-4o mini의 오답을 'trolley' 같은 개별 단어에 귀속시킨 반면, SPEX는 'trolley' 두 번 출현과 'pulling', 'lever' 간의 시너지를 식별했습니다. 이 네 단어를 동의어로 대체하자 모델의 오류율이 거의 0으로 감소했습니다. 데이터 기여도(data attribution)에서 ProxySPEX는 CIFAR-10의 ResNet에 대한 훈련 샘플 간 시너지 및 중복 상호작용을 성공적으로 강조했습니다. 메커니즘 해석 가능성(mechanistic interpretability, 구성 요소 기여도)에서 이 방법은 서로 다른 LLM 계층의 어텐션 헤드가 어떻게 상호작용하는지 밝혀냈고, 가지치기(pruning) 후 다른 방법에 비해 목표 모델 성능을 향상시켰습니다. SPEX와 ProxySPEX의 코드는 SHAP-IQ 저장소에서 제공됩니다.
출처: BAIR (Berkeley AI) —
원문
