SPEX und ProxySPEX: Methoden zur Identifizierung einflussreicher Interaktionen in LLMs im großen Maßstab
Forscher von BAIR (Berkeley AI) stellten SPEX und ProxySPEX vor – Algorithmen, die in der Lage sind, kritische Interaktionen zwischen Merkmalen, Daten und Komponenten von KI-Modellen, einschließlich Large Language Models (LLMs), um Größenordnungen schneller zu identifizieren als bestehende Methoden. Die Verfahren basieren auf der Idee der Sparsität einflussreicher Interaktionen und nutzen Techniken aus der Kodierungstheorie und Signalverarbeitung. Die Anwendung von SPEX zeigte, dass Standard-Attributionsmethoden (zum Beispiel SHAP) komplexe Synergien übersehen können, wie im Fall des Trolley-Problems. ProxySPEX, das die Eigenschaft der Hierarchie ausnutzt, erreicht die gleiche Genauigkeit mit etwa zehnmal weniger Ablationen.
OpenAI

