AraştırmaModeller 🇨🇳 12.08.2026 16:01

Zidong Taichu, GMC Çekirdek Küme Budama Yöntemini Tanıttı: %80 Daha Az Belirteçle Tam Multimodal Yetenek Korunuyor

Çin Bilimler Akademisi Otomasyon Enstitüsü'ndeki Zidong Taichu büyük model ekibi, görsel belirteçleri %90'a kadar azaltırken modelin ortalama performansının %99'undan fazlasını koruyan, eğitim gerektirmeyen bir çekirdek küme budama yöntemi olan GMC'yi (Grounded Message Coreset Pruning) geliştirdi. GMC, görsel-dil modellerindeki görsel belirteçlerin fazlalığını ele alıyor ve Qwen ile LLaVA gibi ana akım modellerle uyumlu, tak-çalıştır bir çözüm sunuyor.
Çin Bilimler Akademisi'ndeki Zidong Taichu ekibi, görsel-dil modelleri için yeni bir çekirdek küme (coreset) budama yöntemi olan GMC'yi (Grounded Message Coreset Pruning) tanıttı. Görsel belirteçler (token) genellikle gereksiz tekrarlar içerir; bu da yüksek grafik işlem birimi (GPU) bellek kullanımına ve yavaş çıkarıma yol açar. Geleneksel Top-K belirteç filtreleme yöntemi yalnızca yüksek puanlı belirteçleri tutar; bunlar da dikkat çekici bölgelerde yoğunlaştığı için bilgi kaybına ve görsel halüsinasyonlara neden olur. GMC, iki aşamalı bir mimari kullanır: bütünleyici kanıta dayalı uyarlanabilir seçim ve popülasyon taşıma. İlk aşama, henüz kapsanmamış kanıtları kapsamaya yaptıkları katkıya göre temel belirteçleri seçer; bu seçimde anlamsal, görsel ve uzamsal yönler dikkate alınır. İkinci aşama ise silinen belirteçlerin gizli durumlarını temsili belirteçlerde toplayarak eğitim gerektirmeden bilgiyi korur. GMC eğitim gerektirmez; görev etiketlerine, optik karakter tanıma (OCR) modellerine veya harici araçlara ihtiyaç duymaz ve Qwen2.5-VL ile LLaVA-1.5 modelleriyle birlikte çalışır. Deneyler, %80,2'lik belirteç azaltımıyla (1296'dan 256'ya) GMC'nin TextVQA, ChartQA ve MME gibi kıyaslamalarda tam modelin ortalama performansının %97,78'ini koruduğunu gösteriyor. %90,1'lik azaltımda ise bu oran %99,11'e çıkıyor. LLaVA-1.5 üzerinde 128 ve 64 belirteçle sırasıyla %99,76 ve %99,82 performans korunuyor. GMC ayrıca POPE, AMBER ve HallusionBench üzerinde görsel halüsinasyonları da azaltıyor. Uzun belge soru-cevap (QA) görevlerinde 1,258 kat hızlanma sağlıyor, Anahtar-Değer Önbelleği'ni (KV Cache) %73,94 küçültüyor ve yanıt kalitesinin %98,87'sini koruyor. Makale arXiv'de yayınlandı.
Kaynak: QbitAI 量子位 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler