Pesquisa 🇺🇸 27.07.2026 15:06

SPEX e ProxySPEX: Métodos para Identificar Interações Influentes em LLMs em Escala

OpenAIOpenAI
Pesquisadores da BAIR (Berkeley AI) introduziram SPEX e ProxySPEX — algoritmos capazes de identificar interações críticas entre características, dados e componentes de modelos de IA, incluindo LLMs, ordens de magnitude mais rápido que os métodos existentes. Os métodos baseiam-se na ideia de esparsidade das interações influentes e usam técnicas da teoria de codificação e processamento de sinais. A aplicação do SPEX mostrou que métodos de atribuição padrão (por exemplo, SHAP) podem perder sinergias complexas, como no caso do problema do vagão de trem. ProxySPEX, que explora a propriedade de hierarquia, alcança a mesma precisão com aproximadamente 10 vezes menos ablações.
Pesquisadores do BAIR (Berkeley Artificial Intelligence Research) desenvolveram os algoritmos SPEX e ProxySPEX para identificar interações influentes entre componentes de sistemas complexos de aprendizado de máquina, incluindo grandes modelos de linguagem (LLMs). O desafio é que o número de interações potenciais cresce exponencialmente com o número de características, pontos de dados ou componentes internos, tornando a enumeração exaustiva computacionalmente inviável. O SPEX aproveita suposições de esparsidade e baixa ordem: o número de interações verdadeiramente influentes é pequeno, e elas envolvem apenas um pequeno subconjunto de elementos. Ao usar ablações estrategicamente selecionadas e algoritmos de recuperação esparsa da teoria de codificação, o SPEX identifica essas interações de forma eficiente. O ProxySPEX explora ainda mais a hierarquia: se uma interação de alta ordem é importante, seus subconjuntos de ordem inferior também são importantes, reduzindo o número de ablações em aproximadamente dez vezes em comparação com o SPEX. Em tarefas de atribuição de características, o SPEX superou métodos existentes em contextos longos (milhares de características). Por exemplo, em um 'problema do bonde' modificado, o método padrão SHAP atribuiu a resposta incorreta do GPT-4o mini a palavras individuais como 'bonde', enquanto o SPEX identificou sinergia entre duas ocorrências de 'bonde' com 'puxar' e 'alavanca'; substituir essas quatro palavras por sinônimos reduziu a taxa de erro do modelo para quase zero. Em atribuição de dados, o ProxySPEX destacou com sucesso interações sinérgicas e redundantes entre amostras de treinamento para a ResNet no CIFAR-10. Em interpretabilidade mecanicista (atribuição de componentes), o método revelou como cabeças de atenção em diferentes camadas do LLM interagem e melhorou o desempenho do modelo alvo após a poda em comparação com outros métodos. O código para SPEX e ProxySPEX está disponível no repositório SHAP-IQ.
Fonte: BAIR (Berkeley AI) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas