Recherche 🇺🇸 27.07.2026 15:06

SPEX et ProxySPEX : des méthodes pour identifier les interactions influentes dans les LLM à grande échelle

OpenAIOpenAI
Des chercheurs du BAIR (Berkeley AI) ont présenté SPEX et ProxySPEX — des algorithmes capables d'identifier les interactions critiques entre les caractéristiques, les données et les composants des modèles d'IA, y compris les LLM, des ordres de grandeur plus rapidement que les méthodes existantes. Les méthodes reposent sur l'idée de parcimonie des interactions influentes et utilisent des techniques issues de la théorie du codage et du traitement du signal. L'application de SPEX a montré que les méthodes d'attribution standard (par exemple, SHAP) peuvent manquer des synergies complexes, comme dans le cas du problème du tramway. ProxySPEX, qui exploite la propriété de hiérarchie, atteint la même précision avec environ 10 fois moins d'ablation.
Des chercheurs du BAIR (Berkeley Artificial Intelligence Research) ont développé les algorithmes SPEX et ProxySPEX pour identifier les interactions influentes entre les composants de systèmes d'apprentissage automatique complexes, y compris les grands modèles de langage (LLM). Le défi réside dans le fait que le nombre d'interactions potentielles croît de manière exponentielle avec le nombre de caractéristiques, de points de données ou de composants internes, rendant une énumération exhaustive impossible sur le plan computationnel. SPEX exploite les hypothèses de parcimonie et de faible degré : le nombre d'interactions véritablement influentes est faible et elles ne concernent qu'un petit sous-ensemble d'éléments. En utilisant des ablations sélectionnées stratégiquement et des algorithmes de récupération parcimonieuse issus de la théorie du codage, SPEX identifie efficacement ces interactions. ProxySPEX exploite en outre la hiérarchie : si une interaction d'ordre élevé est importante, ses sous-ensembles d'ordre inférieur le sont également, ce qui réduit le nombre d'ablations d'environ dix fois par rapport à SPEX. Dans les tâches d'attribution de caractéristiques, SPEX a surpassé les méthodes existantes sur des contextes longs (des milliers de caractéristiques). Par exemple, dans un 'problème du tramway' modifié, la méthode standard SHAP attribuait la réponse incorrecte de GPT-4o mini à des mots individuels comme 'tramway', tandis que SPEX a identifié une synergie entre deux occurrences de 'tramway' avec 'tirer' et 'levier' ; le remplacement de ces quatre mots par des synonymes a réduit le taux d'erreur du modèle à presque zéro. Dans l'attribution de données, ProxySPEX a mis en évidence avec succès les interactions synergiques et redondantes entre les échantillons d'entraînement pour ResNet sur CIFAR-10. En interprétabilité mécaniste (attribution de composants), la méthode a révélé comment les têtes d'attention dans différentes couches de LLM interagissent et a amélioré les performances du modèle cible après élagage par rapport à d'autres méthodes. Le code de SPEX et ProxySPEX est disponible dans le dépôt SHAP-IQ.
Source: BAIR (Berkeley AI) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches