Zidong Taichu apresenta método de poda de núcleo GMC: mantém capacidade multimodal completa com 80% menos tokens
A equipe de modelos grandes Zidong Taichu do Instituto de Automação da Academia Chinesa de Ciências desenvolveu o GMC (Poda de Núcleo de Mensagens Fundamentadas), um método de poda de núcleo sem treinamento que reduz os tokens visuais em até 90% enquanto preserva mais de 99% do desempenho médio do modelo. O GMC aborda a redundância dos tokens visuais em modelos de visão e linguagem, oferecendo uma solução plug-and-play compatível com modelos populares como Qwen e LLaVA.
A equipe Zidong Taichu da Academia Chinesa de Ciências introduziu o GMC (Grounded Message Coreset Pruning), um novo método de poda de coreset para modelos de visão-linguagem. Os tokens visuais são frequentemente redundantes, causando alto uso de memória GPU e inferência lenta. A filtragem tradicional de Top-K tokens retém apenas tokens de alta pontuação, que se concentram em regiões salientes, levando a perda de informação e alucinações visuais. O GMC usa uma arquitetura de dois estágios: seleção adaptativa de evidência complementar e transporte de população. O primeiro estágio seleciona tokens-chave com base em sua contribuição para cobrir evidências não descobertas, considerando aspectos semânticos, visuais e espaciais. O segundo estágio agrega estados ocultos dos tokens deletados em tokens representativos, preservando informações sem treinamento. O GMC não requer treinamento, não precisa de rótulos de tarefas, modelos OCR ou ferramentas externas, e funciona com modelos Qwen2.5-VL e LLaVA-1.5. Experimentos mostram que com redução de 80,2% de tokens (de 1296 para 256), o GMC mantém 97,78% da performance média do modelo completo em benchmarks como TextVQA, ChartQA e MME. Com redução de 90,1%, mantém 99,11%. No LLaVA-1.5, com 128 e 64 tokens, mantém 99,76% e 99,82%, respectivamente. O GMC também reduz alucinações visuais em POPE, AMBER e HallusionBench. Em QA de documentos longos, alcança um speedup de 1,258x, reduz o Cache KV em 73,94% e mantém 98,87% da qualidade das respostas. O artigo está disponível no arXiv.
Fonte: QbitAI 量子位 —
original
