SPEX en ProxySPEX: Methoden voor het identificeren van invloedrijke interacties in LLM's op schaal
OpenAI
Onderzoekers van BAIR (Berkeley AI) hebben SPEX en ProxySPEX geïntroduceerd — algoritmen die kritische interacties tussen kenmerken, gegevens en componenten van AI-modellen, waaronder LLM's, ordes van grootte sneller kunnen identificeren dan bestaande methoden. De methoden zijn gebaseerd op het idee van schaarste van invloedrijke interacties en maken gebruik van technieken uit de coderingstheorie en signaalverwerking. Toepassing van SPEX toonde aan dat standaard attributiemethoden (zoals SHAP) complexe synergieën kunnen missen, zoals in het geval van het trolleyprobleem. ProxySPEX, dat gebruikmaakt van de eigenschap van hiërarchie, bereikt dezelfde nauwkeurigheid met ongeveer 10 keer minder ablatie-experimenten.
Onderzoekers van BAIR (Berkeley Artificial Intelligence Research) hebben algoritmen ontwikkeld, SPEX en ProxySPEX, om invloedrijke interacties tussen componenten van complexe machine learning-systemen te identificeren, waaronder grote taalmodellen (LLM's). De uitdaging is dat het aantal potentiële interacties exponentieel groeit met het aantal kenmerken, datapunten of interne componenten, waardoor volledige enumeratie rekenkundig onhaalbaar is. SPEX maakt gebruik van aannames over schaarste en lage orde: het aantal werkelijk invloedrijke interacties is klein, en ze betreffen slechts een kleine subset van elementen. Door strategisch gekozen ablatie-experimenten en schaarse herstelalgoritmen uit de coderingstheorie te gebruiken, identificeert SPEX deze interacties efficiënt. ProxySPEX maakt verder gebruik van hiërarchie: als een interactie van hoge orde belangrijk is, dan zijn de subgroepen van lagere orde ook belangrijk, wat het aantal ablatie-experimenten met ongeveer een factor tien vermindert in vergelijking met SPEX. Bij taken voor kenmerkattributie presteerde SPEX beter dan bestaande methoden op lange contexten (duizenden kenmerken). In een aangepast 'trolleyprobleem' schreef de standaard SHAP-methode het foutieve antwoord van GPT-4o mini toe aan individuele woorden zoals 'trolley', terwijl SPEX synergie identificeerde tussen twee voorkomens van 'trolley' met 'pulling' en 'lever'; het vervangen van deze vier woorden door synoniemen reduceerde de foutmarge van het model tot bijna nul. Bij data-attributie markeerde ProxySPEX met succes synergistische en redundante interacties tussen trainingsvoorbeelden voor ResNet op CIFAR-10. Bij mechanistische interpreteerbaarheid (componentattributie) onthulde de methode hoe aandachtkoppen in verschillende LLM-lagen interageren en verbeterde de prestaties van het doelsysteem na snoeien in vergelijking met andere methoden. De code voor SPEX en ProxySPEX is beschikbaar in de SHAP-IQ-repository.
Bron: BAIR (Berkeley AI) —
origineel
