SPEX y ProxySPEX: Métodos para Identificar Interacciones Influyentes en LLMs a Escala
OpenAI
Investigadores de BAIR (Berkeley AI) presentaron SPEX y ProxySPEX, algoritmos capaces de identificar interacciones críticas entre características, datos y componentes de modelos de inteligencia artificial, incluidos grandes modelos de lenguaje (LLMs), órdenes de magnitud más rápido que los métodos existentes. Los métodos se basan en la idea de la dispersión de las interacciones influyentes y utilizan técnicas de teoría de codificación y procesamiento de señales. La aplicación de SPEX mostró que los métodos de atribución estándar (por ejemplo, SHAP) pueden pasar por alto sinergias complejas, como en el caso del problema del tranvía. ProxySPEX, que explota la propiedad de jerarquía, logra la misma precisión con aproximadamente 10 veces menos ablaciones.
Investigadores de BAIR (Berkeley Artificial Intelligence Research) han desarrollado los algoritmos SPEX y ProxySPEX para identificar interacciones influyentes entre componentes de sistemas complejos de aprendizaje automático, incluidos los grandes modelos de lenguaje (LLM). El desafío radica en que el número de interacciones potenciales crece exponencialmente con la cantidad de características, puntos de datos o componentes internos, lo que hace que la enumeración exhaustiva sea computacionalmente inviable. SPEX aprovecha la dispersión y los supuestos de bajo orden: el número de interacciones verdaderamente influyentes es pequeño y estas involucran solo un subconjunto reducido de elementos. Mediante el uso de ablaciones estratégicamente seleccionadas y algoritmos de recuperación dispersa de la teoría de codificación, SPEX identifica estas interacciones de manera eficiente. ProxySPEX explota además la jerarquía: si una interacción de alto orden es importante, sus subconjuntos de orden inferior también lo son, lo que reduce el número de ablaciones aproximadamente diez veces en comparación con SPEX. En tareas de atribución de características, SPEX superó a los métodos existentes en contextos largos (miles de características). Por ejemplo, en un 'dilema del tranvía' modificado, el método estándar SHAP atribuyó la respuesta incorrecta de GPT-4o mini a palabras individuales como 'tranvía', mientras que SPEX identificó una sinergia entre dos apariciones de 'tranvía' con 'tirar' y 'palanca'; al reemplazar estas cuatro palabras con sinónimos, la tasa de error del modelo se redujo a casi cero. En la atribución de datos, ProxySPEX destacó con éxito las interacciones sinérgicas y redundantes entre las muestras de entrenamiento para ResNet en CIFAR-10. En interpretabilidad mecanicista (atribución de componentes), el método reveló cómo los cabezales de atención en diferentes capas de los LLM interactúan y mejoró el rendimiento del modelo objetivo después de la poda en comparación con otros métodos. El código de SPEX y ProxySPEX está disponible en el repositorio SHAP-IQ.
Fuente: BAIR (Berkeley AI) —
original
