OnderzoekModellen 🇨🇳 15.08.2026 11:03

Nieuwe route voor LLM-interpreteerbaarheid: gewichtsdecompositie met datakosten onder 1%

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Onderzoekers van IQuest Research, Safe AI Forum, Oxford, Stanford en Tsinghua stellen Sparse Weight Decomposition (SWD) voor, een methode om grote taalmodellen te interpreteren door voorgetrainde gewichtsmatrices te ontbinden in sparse factoren, waardoor het trainen van afzonderlijke vervangingsnetwerken niet meer nodig is. SWD gebruikt minder dan 1% van de data die trainingsgebaseerde baselines zoals Transcoder nodig hebben, schaalt naar 27B-modellen en maakt circuitextractie en gerichte bewerking direct vanuit gewichten mogelijk.
Het IQuest Research Institute stelt samen met medewerkers van Safe AI Forum, de University of Oxford, Stanford University en Tsinghua University een nieuwe aanpak voor voor mechanistische interpreteerbaarheid van grote taalmodellen, genaamd Sparse Weight Decomposition (SWD). In plaats van een apart sparse representatienetwerk te trainen om de lagen van een model te benaderen, decomposeert SWD direct een dichte gewichtsmatrix in twee sparse matrices A en B, waarbij de gedeelde tussenliggende dimensies bottleneck-eenheden worden die onafhankelijk kunnen worden gescoord, geselecteerd en geableerd. Hierdoor kunnen onderzoekers taakcircuits rechtstreeks uit de gewichten halen. In experimenten met één matrix die de vervangingsgetrouwheid evenaren, gebruikt SWD minder dan 1% van de gegevens die nodig zijn voor op training gebaseerde baselines zoals Transcoder. Op GPT-2, Qwen2.5 en Qwen3.5-27B bereikt SWD doorgaans dezelfde sufficiëntie- en noodzakelijkheidsdoelen met minder bottleneck-eenheden en actieve verbindingen. De methode schaalt naar 27B-modellen en dekt alle 48 aandacht- en MLP-gewichtsmatrices van GPT-2 Small, met een nuldata-versie die geen kalibratietekst vereist. Het artikel meldt dat in GPT-2 Small SWD een lage CE-delta bereikt met slechts duizenden kalibratietokens, terwijl op training gebaseerde baselines ongeveer 10^6 tokens nodig hebben. Volledige modelvervanging op GPT-2 Small, met behulp van SWD-FT, verlaagt CE van 3,90 naar 3,44 met hetzelfde aantal verbindingen, met ongeveer 20,6 miljoen tokens vergeleken met 2,884 miljard voor een sparse pre-training baseline. Semantische analyse van hoog scorende bottleneck-eenheden op de GreaterThan-taak toont aan dat vier van de zes eenheden reageren op getallen, jaren, hoeveelheden of maten. Een gericht bewerkingsexperiment op een enkele eenheid (c205) verhoogde de logitmarge voor het juiste antwoord met 0,216 met minimale bijwerkingen, wat aantoont dat SWD-afgeleide richtingen kunnen worden gebruikt voor nauwkeurige gedragscontrole.
Bron: QbitAI 量子位 — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws