RechercheModèles 🇨🇳 15.08.2026 11:03

Nouvelle voie pour l'interprétabilité des LLM : décomposition des poids avec un coût en données inférieur à 1%

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Des chercheurs de IQuest Research, Safe AI Forum, Oxford, Stanford et Tsinghua proposent la décomposition de poids parcimonieuse (SWD), une méthode pour interpréter les grands modèles de langage en décomposant les matrices de poids pré-entraînées en facteurs parcimonieux, éliminant le besoin d'entraîner des réseaux de remplacement séparés. SWD utilise moins de 1% des données requises par les modèles de référence basés sur l'entraînement comme Transcoder, s'adapte aux modèles de 27 milliards de paramètres et permet l'extraction de circuits et l'édition ciblée directement à partir des poids.
L'Institut de recherche IQuest, en collaboration avec le Forum IA sûr, l'Université d'Oxford, l'Université de Stanford et l'Université Tsinghua, propose une nouvelle approche de l'interprétabilité mécaniste des grands modèles de langage, nommée décomposition de poids creuse (SWD). Plutôt que d'entraîner un réseau de représentation creuse séparé pour approximer les couches d'un modèle, SWD décompose directement une matrice de poids dense en deux matrices creuses A et B, où les dimensions intermédiaires partagées deviennent des unités de goulot d'étranglement qui peuvent être notées, sélectionnées et ablations de manière indépendante. Cela permet aux chercheurs d'extraire directement les circuits de tâches à partir des poids. Dans des expériences sur matrice unique comparant la fidélité de remplacement, SWD utilise moins de 1 % des données requises par les références basées sur l'entraînement comme Transcoder. Sur GPT-2, Qwen2.5 et Qwen3.5-27B, SWD atteint généralement les mêmes cibles de suffisance et de nécessité avec moins d'unités de goulot d'étranglement et de connexions actives. La méthode s'étend à des modèles de 27 milliards de paramètres et couvre les 48 matrices de poids d'attention et de perceptron multicouche (MLP) de GPT-2 Small, avec une version sans données ne nécessitant aucun texte de calibration. Le rapport indique que dans GPT-2 Small, SWD atteint un faible delta d'entropie croisée avec seulement des milliers de jetons de calibration, alors que les références basées sur l'entraînement nécessitent environ 10^6 jetons. Le remplacement de modèle complet sur GPT-2 Small, utilisant SWD-FT, réduit l'entropie croisée de 3,90 à 3,44 avec le même nombre de connexions, en utilisant environ 20,6 millions de jetons contre 2,884 milliards pour une référence de pré-entraînement creuse. L'analyse sémantique des unités de goulot d'étranglement de haut rang sur la tâche GreaterThan montre que quatre des six unités répondent aux nombres, aux années, aux quantités ou aux mesures. Une expérience d'édition ciblée sur une unité unique (c205) a augmenté la marge logarithmique pour la réponse correcte de 0,216 avec des effets secondaires minimes, démontrant que les directions dérivées de SWD peuvent être utilisées pour un contrôle précis du comportement.
Source: QbitAI 量子位 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches