Jalur Baru untuk Interpretabilitas Model Bahasa Besar: Dekomposisi Bobot dengan Biaya Data di Bawah 1%
OpenAI
Alibaba/Qwen
Para peneliti dari IQuest Research, Safe AI Forum, Oxford, Stanford, dan Tsinghua mengusulkan Dekomposisi Bobot Sparse (SWD), sebuah metode untuk menginterpretasi model bahasa besar dengan mendekomposisi matriks bobot yang telah dilatih menjadi faktor-faktor sparse, sehingga menghilangkan kebutuhan untuk melatih jaringan pengganti terpisah. SWD menggunakan kurang dari 1% data yang dibutuhkan oleh baseline berbasis pelatihan seperti Transcoder, dapat diskalakan ke model 27 miliar parameter, dan memungkinkan ekstraksi sirkuit serta penyuntingan tertarget langsung dari bobot.
IQuest Research Institute, bersama kolaborator dari Safe AI Forum, Universitas Oxford, Universitas Stanford, dan Universitas Tsinghua, mengusulkan pendekatan baru untuk interpretabilitas mekanistik model bahasa besar, yang diberi nama Sparse Weight Decomposition (SWD). Alih-alih melatih jaringan representasi sparse terpisah untuk mendekati lapisan model, SWD secara langsung menguraikan matriks bobot dense menjadi dua matriks sparse A dan B, di mana dimensi antara yang dibagi menjadi unit bottleneck yang dapat diberi skor, dipilih, dan diablasikan secara independen. Hal ini memungkinkan peneliti untuk mengekstrak sirkuit tugas langsung dari bobot. Dalam eksperimen matriks tunggal yang sesuai dengan fidelitas penggantian, SWD menggunakan kurang dari 1% data yang dibutuhkan oleh baseline berbasis pelatihan seperti Transcoder. Pada GPT-2, Qwen2.5, dan Qwen3.5-27B, SWD biasanya mencapai target kecukupan dan kebutuhan yang sama dengan lebih sedikit unit bottleneck dan koneksi aktif. Metode ini dapat diskalakan hingga model 27B dan mencakup semua 48 matriks bobot perhatian dan MLP dari GPT-2 Small, dengan versi tanpa data yang tidak memerlukan teks kalibrasi. Makalah ini melaporkan bahwa pada GPT-2 Small, SWD mencapai delta CE rendah hanya dengan ribuan token kalibrasi, sedangkan baseline berbasis pelatihan membutuhkan sekitar 10^6 token. Penggantian model penuh pada GPT-2 Small, menggunakan SWD-FT, mengurangi CE dari 3,90 menjadi 3,44 dengan jumlah koneksi yang sama, menggunakan sekitar 20,6 juta token dibandingkan dengan 2,884 miliar untuk baseline pretraining sparse. Analisis semantik unit bottleneck peringkat tinggi pada tugas GreaterThan menunjukkan bahwa empat dari enam unit merespons angka, tahun, kuantitas, atau ukuran. Eksperimen pengeditan yang ditargetkan pada satu unit (c205) meningkatkan margin logit untuk jawaban yang benar sebesar 0,216 dengan efek samping minimal, menunjukkan bahwa arah turunan SWD dapat digunakan untuk kontrol perilaku yang presisi.
Sumber: QbitAI 量子位 —
asli
