紫东太初提出GMC核心集剪枝方法:减少80%令牌仍保留完整多模态能力
中国科学院自动化研究所紫东太初大模型团队开发了GMC(Grounded Message核心集剪枝)这一无需训练的核心集剪枝方法,可将视觉令牌减少高达90%,同时保留模型平均性能的99%以上。GMC针对视觉语言模型中视觉令牌冗余的问题,提供了一种即插即用的解决方案,兼容Qwen和LLaVA等主流模型。
中国科学院自动化所团队提出了GMC(Grounded Message Coreset Pruning),一种针对视觉语言模型的新型核心集剪枝方法。视觉标记通常冗余,导致高GPU内存占用和推理缓慢。传统的Top-K标记过滤仅保留高分标记,这些标记集中在显著区域,导致信息丢失和视觉幻觉。GMC采用双阶段架构:互补证据自适应选择与种群传输。第一阶段根据标记对覆盖未发现证据的贡献来选择关键标记,考虑语义、视觉和空间方面。第二阶段将已删除标记的隐藏状态聚合到代表性标记中,在不训练的情况下保留信息。GMC无需训练,无需任务标签、OCR模型或外部工具,适用于Qwen2.5-VL和LLaVA-1.5模型。实验表明,当标记减少80.2%(从1296减少到256)时,GMC在TextVQA、ChartQA和MME等基准测试中保留了全模型平均性能的97.78%。当减少90.1%时,保留了99.11%。在LLaVA-1.5上,使用128和64个标记时,分别保留了99.76%和99.82%。GMC还减少了POPE、AMBER和HallusionBench上的视觉幻觉。在长文档问答中,实现了1.258倍加速,KV Cache减少了73.94%,并保持了98.87%的答案质量。该论文可在arXiv上获取。
来源: QbitAI 量子位 —
原文
