TutkimusMallit 🇨🇳 15.08.2026 11:03

Uusi reitti LLM-tulkittavuuteen: painojen hajottaminen alle prosentin datakustannuksella

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Tutkijat IQuest Researchista, Safe AI Forumista, Oxfordista, Stanfordista ja Tsinghuasta ehdottavat harvaa painohajotelmaa (Sparse Weight Decomposition, SWD), menetelmää suurten kielimallien tulkitsemiseen hajottamalla esikoulutetut painomatriisit harvoiksi tekijöiksi, mikä poistaa tarpeen kouluttaa erillisiä korvaavia verkkoja. SWD käyttää alle prosentin siitä datasta, jota harjoituspohjaiset perusmenetelmät, kuten Transcoder, vaativat, skaalautuu 27 miljardin parametrin malleihin ja mahdollistaa piirien erottamisen ja kohdennetun muokkaamisen suoraan painoista.
IQuest Research Institute yhdessä Safe AI Forumin, Oxfordin yliopiston, Stanfordin yliopiston ja Tsinghuan yliopiston tutkijoiden kanssa ehdottaa uutta lähestymistapaa suurten kielimallien mekanistiseen tulkittavuuteen, jonka nimi on Sparse Weight Decomposition (SWD). Sen sijaan, että koulutettaisiin erillinen harva esitysverkko approksimoimaan mallin kerroksia, SWD hajottaa suoraan tiheän painomatriisin kahdeksi harvaksi matriisiksi A ja B, joissa jaetut väliulottuvuudet toimivat pullonkaulayksiköinä, joita voidaan itsenäisesti pisteyttää, valita ja poistaa. Tämä mahdollistaa tutkijoille tehtäväpiirien poimimisen suoraan painoista. Yhden matriisin kokeissa, joissa verrataan korvaustarkkuutta, SWD käyttää alle 1 prosentin siitä datamäärästä, jota koulutuspohjaiset vertailumenetelmät, kuten Transcoder, vaativat. GPT-2-, Qwen2.5- ja Qwen3.5-27B-malleilla SWD saavuttaa tyypillisesti samat riittävyys- ja välttämättömyystavoitteet pienemmällä määrällä pullonkaulayksiköitä ja aktiivisia yhteyksiä. Menetelmä skaalautuu 27B-malleihin ja kattaa kaikki GPT-2 Smallin 48 huomio- ja MLP-painomatriisia, ja siitä on olemassa myös nolladataversio, joka ei vaadi kalibrointitekstiä. Raportin mukaan GPT-2 Smallissa SWD saavuttaa matalan ristientropia-deltan vain tuhansilla kalibrointitokeneilla, kun taas koulutuspohjaiset vertailumenetelmät tarvitsevat noin 10^6 tokenia. Koko mallin korvaaminen GPT-2 Smallissa SWD-FT:llä vähentää ristientropian arvosta 3.90 arvoon 3.44 samalla yhteyksien määrällä, käyttäen noin 20,6 miljoonaa tokenia verrattuna 2,884 miljardiin tokeniin harvan esikoulutuksen vertailumenetelmässä. Korkean sijoituksen saaneiden pullonkaulayksiköiden semanttinen analyysi GreaterThan-tehtävässä osoittaa, että neljä kuudesta yksiköstä reagoi numeroihin, vuosiin, määriin tai mittayksiköihin. Kohdennettu editointikoe yhdellä yksiköllä (c205) lisäsi oikean vastauksen logit-marginaalia 0,216:lla minimaalisilla sivuvaikutuksilla, mikä osoittaa, että SWD:stä johdettuja suuntia voidaan käyttää tarkkaan käyttäytymisen hallintaan.
Lähde: QbitAI 量子位 — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset