SPEX ja ProxySPEX: Menetelmät vaikuttavien vuorovaikutusten tunnistamiseen suurissa kielimalleissa
OpenAI
BAIR (Berkeley AI -tutkimusryhmä) esitteli SPEX- ja ProxySPEX-algoritmit, jotka pystyvät tunnistamaan kriittisiä vuorovaikutuksia piirteiden, datan ja tekoälymallien komponenttien välillä, mukaan lukien suuret kielimallit, kertaluokkia nopeammin kuin olemassa olevat menetelmät. Menetelmät perustuvat ajatukseen vaikuttavien vuorovaikutusten harvuudesta ja hyödyntävät koodausteoriasta ja signaalinkäsittelystä saatuja tekniikoita. SPEXin soveltaminen osoitti, että tavanomaiset attribuointimenetelmät (esim. SHAP) voivat jättää huomiotta monimutkaisia synergioita, kuten ongelmanratkaisutehtävässä (trolley problem). ProxySPEX, joka hyödyntää hierarkiaominaisuutta, saavuttaa saman tarkkuuden noin kymmenen kertaa vähemmillä ablaatioilla.
Berkeleyssä toimivan tekoälytutkimuslaboratorion BAIRin tutkijat ovat kehittäneet SPEX- ja ProxySPEX-algoritmit tunnistamaan vaikutusvaltaisia vuorovaikutuksia monimutkaisten koneoppimisjärjestelmien, kuten suurten kielimallien, komponenttien välillä. Haasteena on, että mahdollisten vuorovaikutusten määrä kasvaa eksponentiaalisesti ominaisuuksien, datapisteiden tai sisäisten komponenttien määrän myötä, mikä tekee tyhjentävästä läpikäynnistä laskennallisesti mahdotonta. SPEX hyödyntää harvuutta ja matalan asteen oletuksia: todella vaikutusvaltaisten vuorovaikutusten määrä on pieni, ja ne koskevat vain pientä osajoukkoa elementtejä. Käyttämällä strategisesti valittuja ablaatioita ja harvuuden palautusalgoritmeja koodausteoriasta, SPEX tunnistaa nämä vuorovaikutukset tehokkaasti. ProxySPEX puolestaan hyödyntää hierarkiaa: jos korkean asteen vuorovaikutus on tärkeä, sen alemman asteen osajoukot ovat myös tärkeitä, mikä vähentää ablaatioiden määrää noin kymmenkertaisesti SPEXiin verrattuna. Ominaisuuksien attribuointitehtävissä SPEX ylitti olemassa olevat menetelmät pitkillä konteksteilla (tuhansia ominaisuuksia). Esimerkiksi muokatussa 'trolley ongelmassa' tavallinen SHAP-menetelmä liitti GPT-4o mini -mallin virheellisen vastauksen yksittäisiin sanoihin kuten 'trolley', kun taas SPEX tunnisti synkronian kahden 'trolley'-esiintymän välillä sanojen 'pulling' ja 'lever' kanssa; näiden neljän sanan korvaaminen synonyymeilla vähensi mallin virheprosentin lähes nollaan. Data-attribuutiossa ProxySPEX onnistui korostamaan synkronisia ja redundanteja vuorovaikutuksia ResNet-mallin koulutusnäytteiden välillä CIFAR-10-aineistossa. Mekaanisessa tulkittavuudessa (komponenttiattribuutio) menetelmä paljasti, miten eri LLM-kerroksien huomiopäät ovat vuorovaikutuksessa, ja paransi kohdemallin suorituskykyä karsinnan jälkeen verrattuna muihin menetelmiin. SPEXin ja ProxySPEXin koodi on saatavilla SHAP-IQ-repositoriossa.
Lähde: BAIR (Berkeley AI) —
Alkuperäinen
