AraştırmaModeller 🇨🇳 15.08.2026 11:03

LLM Yorumlanabilirliği İçin Yeni Rota: Veri Maliyeti %1'in Altında Ağırlık Ayrıştırması

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
IQuest Research, Safe AI Forum, Oxford, Stanford ve Tsinghua'dan araştırmacılar, önceden eğitilmiş ağırlık matrislerini seyrek faktörlere ayrıştırarak büyük dil modellerini yorumlamak için bir yöntem olan Seyrek Ağırlık Ayrıştırmasını (SWD) öneriyor ve ayrı yedek ağlar eğitme ihtiyacını ortadan kaldırıyor. SWD, Transcoder gibi eğitim tabanlı temellere göre %1'den az veri kullanıyor, 27 milyar parametreli modellere ölçekleniyor ve doğrudan ağırlıklardan devre çıkarma ve hedefli düzenleme sağlıyor.
IQuest Araştırma Enstitüsü, Safe AI Forum, Oxford Üniversitesi, Stanford Üniversitesi ve Tsinghua Üniversitesi'nden araştırmacılarla birlikte, büyük dil modellerinin mekanik yorumlanabilirliği için Seyrek Ağırlık Ayrıştırması (Sparse Weight Decomposition - SWD) adı verilen yeni bir yaklaşım önermektedir. SWD, bir modelin katmanlarını yaklaşık olarak temsil etmek için ayrı bir seyrek temsil ağı eğitmek yerine, yoğun bir ağırlık matrisini doğrudan iki seyrek matris olan A ve B'ye ayrıştırır; burada paylaşılan ara boyutlar, bağımsız olarak puanlanabilen, seçilebilen ve çıkarılabilen darboğaz birimleri haline gelir. Bu, araştırmacıların görev devrelerini doğrudan ağırlıklardan çıkarmasına olanak tanır. Değiştirme doğruluğunu eşleştiren tek matrisli deneylerde SWD, Transcoder gibi eğitim tabanlı temel yöntemlerin gerektirdiği verinin %1'inden daha azını kullanır. GPT-2, Qwen2.5 ve Qwen3.5-27B üzerinde SWD, daha az darboğaz birimi ve aktif bağlantı ile genellikle aynı yeterlilik ve gereklilik hedeflerine ulaşır. Yöntem 27B modele ölçeklenir ve GPT-2 Small'ın tüm 48 dikkat ve MLP ağırlık matrisini kapsar; kalibrasyon metni gerektirmeyen sıfır veri sürümüyle birlikte. Makale, GPT-2 Small'da SWD'nin yalnızca birkaç bin kalibrasyon tokeni ile düşük CE delta elde ettiğini, eğitim tabanlı temel yöntemlerin ise yaklaşık 10^6 token gerektirdiğini bildirmektedir. SWD-FT kullanılarak GPT-2 Small üzerinde yapılan tam model değişimi, aynı sayıda bağlantı ile CE'yi 3.90'dan 3.44'e düşürür ve seyrek ön eğitim temel yöntemi için 2.884 milyar tokena kıyasla yaklaşık 20.6 milyon token kullanır. GreaterThan görevinde yüksek sıralı darboğaz birimlerinin anlamsal analizi, altı birimden dördünün sayılara, yıllara, miktarlara veya ölçülere yanıt verdiğini göstermektedir. Tek bir birim (c205) üzerinde yapılan hedefli düzenleme deneyi, doğru yanıt için logit marjını minimum yan etki ile 0.216 artırmış ve SWD'den türetilen yönelimlerin hassas davranış kontrolü için kullanılabileceğini göstermiştir.
Kaynak: QbitAI 量子位 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler