Novo Caminho para Interpretabilidade de LLM: Decomposição de Pesos com Custo de Dados Inferior a 1%
OpenAI
Alibaba/Qwen
Pesquisadores da IQuest Research, Safe AI Forum, Oxford, Stanford e Tsinghua propõem a Decomposição Esparsa de Pesos (SWD), um método para interpretar grandes modelos de linguagem decompondo matrizes de pesos pré-treinados em fatores esparsos, eliminando a necessidade de treinar redes substitutas separadas. A SWD usa menos de 1% dos dados exigidos por bases de treinamento como Transcoder, escala para modelos de 27B e permite extração de circuitos e edição direcionada diretamente dos pesos.
O Instituto de Pesquisa IQuest, em colaboração com o Fórum Safe AI, a Universidade de Oxford, a Universidade Stanford e a Universidade Tsinghua, propõe uma nova abordagem para a interpretabilidade mecanicista de grandes modelos de linguagem, denominada Decomposição Esparsa de Pesos (SWD). Em vez de treinar uma rede de representação esparsa separada para aproximar as camadas de um modelo, a SWD decompõe diretamente uma matriz de pesos densa em duas matrizes esparsas A e B, onde as dimensões intermediárias compartilhadas se tornam unidades de gargalo que podem ser pontuadas, selecionadas e ablacionadas de forma independente. Isso permite que os pesquisadores extraiam circuitos de tarefas diretamente dos pesos. Em experimentos com matriz única que correspondem à fidelidade de substituição, a SWD usa menos de 1% dos dados exigidos pelas linhas de base baseadas em treinamento, como o Transcoder. Em GPT-2, Qwen2.5 e Qwen3.5-27B, a SWD normalmente atinge os mesmos alvos de suficiência e necessidade com menos unidades de gargalo e conexões ativas. O método escala para modelos de 27B e cobre todas as 48 matrizes de pesos de atenção e MLP do GPT-2 Small, com uma versão sem dados que não requer texto de calibração. O artigo relata que, no GPT-2 Small, a SWD atinge um baixo delta de entropia cruzada (CE) com apenas milhares de tokens de calibração, enquanto as linhas de base baseadas em treinamento precisam de cerca de 10^6 tokens. A substituição completa do modelo no GPT-2 Small, usando SWD-FT, reduz a CE de 3,90 para 3,44 com o mesmo número de conexões, usando cerca de 20,6 milhões de tokens em comparação com 2,884 bilhões para uma linha de base de pré-treinamento esparso. A análise semântica das unidades de gargalo de alta classificação na tarefa GreaterThan mostra que quatro das seis unidades respondem a números, anos, quantidades ou medidas. Um experimento de edição direcionada em uma única unidade (c205) aumentou a margem de logit para a resposta correta em 0,216 com efeitos colaterais mínimos, demonstrando que as direções derivadas da SWD podem ser usadas para controle preciso do comportamento.
Fonte: QbitAI 量子位 —
original
