InvestigaciónModelos 🇨🇳 15.08.2026 11:03

Nueva vía para la interpretabilidad de los LLM: descomposición de pesos con un costo de datos inferior al 1%

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Investigadores de IQuest Research, Safe AI Forum, Oxford, Stanford y Tsinghua proponen la Descomposición de Pesos Dispersa (SWD), un método para interpretar grandes modelos de lenguaje descomponiendo las matrices de pesos preentrenadas en factores dispersos, eliminando la necesidad de entrenar redes de reemplazo separadas. La SWD usa menos del 1% de los datos requeridos por los métodos basados en entrenamiento como Transcoder, se escala a modelos de 27B y permite la extracción de circuitos y la edición dirigida directamente desde los pesos.
El Instituto de Investigación IQuest, junto con colaboradores del Foro de IA Segura, la Universidad de Oxford, la Universidad de Stanford y la Universidad de Tsinghua, propone un nuevo enfoque para la interpretabilidad mecanicista de los grandes modelos de lenguaje, denominado Descomposición de Pesos Dispersos (SWD, por sus siglas en inglés). En lugar de entrenar una red de representación dispersa separada para aproximar las capas de un modelo, SWD descompone directamente una matriz de pesos densa en dos matrices dispersas A y B, donde las dimensiones intermedias compartidas se convierten en unidades de cuello de botella que pueden evaluarse, seleccionarse y eliminarse de forma independiente. Esto permite a los investigadores extraer circuitos de tareas directamente de los pesos. En experimentos de matrices individuales que comparan la fidelidad de reemplazo, SWD utiliza menos del 1 por ciento de los datos requeridos por las líneas base basadas en entrenamiento, como Transcoder. En GPT-2, Qwen2.5 y Qwen3.5-27B, SWD alcanza típicamente los mismos objetivos de suficiencia y necesidad con menos unidades de cuello de botella y conexiones activas. El método se escala a modelos de 27B y cubre las 48 matrices de pesos de atención y MLP de GPT-2 Small, con una versión sin datos que no requiere texto de calibración. El artículo informa que en GPT-2 Small, SWD logra un bajo delta de CE con solo miles de tokens de calibración, mientras que las líneas base basadas en entrenamiento necesitan alrededor de 10^6 tokens. El reemplazo completo del modelo en GPT-2 Small, utilizando SWD-FT, reduce la CE de 3,90 a 3,44 con el mismo número de conexiones, usando aproximadamente 20,6 millones de tokens en comparación con 2,884 mil millones para una línea base de preentrenamiento disperso. El análisis semántico de las unidades de cuello de botella de alto rango en la tarea GreaterThan muestra que cuatro de seis unidades responden a números, años, cantidades o medidas. Un experimento de edición dirigida en una sola unidad (c205) aumentó el margen logit para la respuesta correcta en 0,216 con efectos secundarios mínimos, demostrando que las direcciones derivadas de SWD pueden utilizarse para un control preciso del comportamiento."
Fuente: QbitAI 量子位 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas