Araştırma 🇺🇸 27.07.2026 15:06

SPEX ve ProxySPEX: Büyük Dil Modellerinde Etkili Etkileşimleri Büyük Ölçekte Tanımlama Yöntemleri

OpenAIOpenAI
BAIR (Berkeley AI) araştırmacıları, SPEX ve ProxySPEX algoritmalarını tanıttı. Bu algoritmalar, yapay zeka modellerinde (büyük dil modelleri dahil) özellikler, veriler ve bileşenler arasındaki kritik etkileşimleri mevcut yöntemlerden büyüklük sırasına göre daha hızlı tespit edebiliyor. Yöntemler, etkili etkileşimlerin seyrekliği fikrine dayanıyor ve kodlama teorisi ile sinyal işleme tekniklerini kullanıyor. SPEX'in uygulanması, standart atıf yöntemlerinin (örneğin, SHAP) tramvay problemi örneğindeki gibi karmaşık sinerjileri gözden kaçırabileceğini gösterdi. Hiyerarşi özelliğinden yararlanan ProxySPEX ise yaklaşık 10 kat daha az ablatyon ile aynı doğruluğa ulaşıyor.
BAIR (Berkeley Artificial Intelligence Research) araştırmacıları, büyük dil modelleri (LLM'ler) dahil olmak üzere karmaşık makine öğrenimi sistemlerinin bileşenleri arasındaki etkili etkileşimleri belirlemek için SPEX ve ProxySPEX algoritmalarını geliştirdi. Zorluk, potansiyel etkileşim sayısının özellik, veri noktası veya iç bileşen sayısıyla katlanarak artması ve kapsamlı numaralandırmayı hesaplama açısından uygulanamaz hale getirmesidir. SPEX, seyreklik ve düşük derece varsayımlarından yararlanır: gerçekten etkili etkileşimlerin sayısı azdır ve yalnızca küçük bir öğe alt kümesini içerirler. Stratejik olarak seçilmiş çıkarmalar ve kodlama teorisinden seyrek geri kazanım algoritmaları kullanarak SPEX bu etkileşimleri verimli bir şekilde tanımlar. ProxySPEX ayrıca hiyerarşiden yararlanır: yüksek dereceli bir etkileşim önemliyse, alt dereceli alt kümeleri de önemlidir ve bu, SPEX'e kıyasla çıkarma sayısını yaklaşık on kat azaltır. Özellik atfı görevlerinde SPEX, uzun bağlamlarda (binlerce özellik) mevcut yöntemlerden daha iyi performans gösterdi. Örneğin, değiştirilmiş bir 'tramvay problemi'nde, standart SHAP yöntemi GPT-4o mini'nin yanlış cevabını 'tramvay' gibi tek tek kelimelere atfederken, SPEX iki 'tramvay' geçişinin 'çekme' ve 'kaldıraç' ile sinerjisini tespit etti; bu dört kelimeyi eşanlamlılarıyla değiştirmek modelin hata oranını sıfıra yaklaştırdı. Veri atfında, ProxySPEX, CIFAR-10 üzerinde ResNet için eğitim örnekleri arasındaki sinerjik ve yedekli etkileşimleri başarıyla vurguladı. Bileşen atfı (mekanik yorumlanabilirlik) kapsamında yöntem, farklı LLM katmanlarındaki dikkat başlıklarının nasıl etkileşime girdiğini ortaya çıkardı ve diğer yöntemlere kıyasla budama sonrası hedef model performansını iyileştirdi. SPEX ve ProxySPEX kodları SHAP-IQ deposunda mevcuttur.
Kaynak: BAIR (Berkeley AI) — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler