RisetModel 🇨🇳 12.08.2026 16:01

Zidong Taichu Memperkenalkan Metode Pemangkasan Coreset GMC: Mempertahankan Kemampuan Multimodal Penuh dengan 80% Lebih Sedikit Token

Tim model besar Zidong Taichu di Institute of Automation, Chinese Academy of Sciences, telah mengembangkan GMC (Grounded Message Coreset Pruning), metode pemangkasan coreset tanpa pelatihan yang mengurangi token visual hingga 90% sambil mempertahankan lebih dari 99% kinerja rata-rata model. GMC mengatasi redundansi token visual dalam model visi-bahasa, menawarkan solusi plug-and-play yang kompatibel dengan model mainstream seperti Qwen dan LLaVA.
Tim Zidong Taichu di Akademi Ilmu Pengetahuan China telah memperkenalkan GMC (Grounded Message Coreset Pruning), sebuah metode pemangkasan coreset baru untuk model visi-bahasa. Token visual sering kali redundan, menyebabkan penggunaan memori GPU yang tinggi dan inferensi yang lambat. Pemfilteran Top-K tradisional hanya mempertahankan token dengan skor tinggi, yang terkonsentrasi di wilayah yang menonjol, menyebabkan hilangnya informasi dan halusinasi visual. GMC menggunakan arsitektur dua tahap: seleksi adaptif bukti komplementer dan transportasi populasi. Tahap pertama memilih token kunci berdasarkan kontribusinya dalam mencakup bukti yang belum terungkap, dengan mempertimbangkan aspek semantik, visual, dan spasial. Tahap kedua mengagregasi status tersembunyi dari token yang dihapus ke token representatif, menjaga informasi tanpa pelatihan. GMC bebas pelatihan, tidak memerlukan label tugas, model OCR, atau alat eksternal, dan bekerja dengan model Qwen2.5-VL dan LLaVA-1.5. Eksperimen menunjukkan bahwa dengan pengurangan token 80,2% (dari 1296 menjadi 256), GMC mempertahankan 97,78% dari kinerja rata-rata model penuh pada benchmark seperti TextVQA, ChartQA, dan MME. Dengan pengurangan 90,1%, ia mempertahankan 99,11%. Pada LLaVA-1.5, dengan 128 dan 64 token, ia mempertahankan 99,76% dan 99,82% masing-masing. GMC juga mengurangi halusinasi visual pada POPE, AMBER, dan HallusionBench. Dalam QA dokumen panjang, ia mencapai percepatan 1,258 kali lipat, mengurangi KV Cache sebesar 73,94%, dan mempertahankan kualitas jawaban 98,87%. Makalah ini tersedia di arXiv.
Sumber: QbitAI 量子位 — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru