Zidong Taichu introduceert GMC Coreset Pruning-methode: behoudt volledige multimodale capaciteit met 80% minder tokens
Het Zidong Taichu large model team van het Institute of Automation van de Chinese Academie van Wetenschappen heeft GMC (Grounded Message Coreset Pruning) ontwikkeld, een trainingsvrije coreset-pruningmethode die visuele tokens met tot wel 90% reduceert terwijl meer dan 99% van de gemiddelde prestaties van het model behouden blijft. GMC pakt de redundantie van visuele tokens in visie-taalmodelen aan en biedt een plug-and-play-oplossing die compatibel is met gangbare modellen zoals Qwen en LLaVA.
Het Zidong Taichu-team van de Chinese Academie van Wetenschappen heeft GMC (Grounded Message Coreset Pruning) geïntroduceerd, een nieuwe coreset-pruningsmethode voor vision-language-modellen. Visuele tokens zijn vaak redundant, wat leidt tot hoog GPU- geheugengebruik en trage inferentie. Traditionele Top-K-tokenfiltering behoudt alleen tokens met hoge scores, die geconcentreerd zijn in prominente gebieden, wat leidt tot informatieverlies en visuele hallucinaties. GMC gebruikt een tweetrapsarchitectuur: adaptieve selectie van complementair bewijs en populatietransport. De eerste fase selecteert sleuteltokens op basis van hun bijdrage aan het dekken van onbedekt bewijs, rekening houdend met semantische, visuele en ruimtelijke aspecten. De tweede fase aggregeert verborgen toestanden van verwijderde tokens in representatieve tokens, waardoor informatie behouden blijft zonder training. GMC is trainingsvrij, vereist geen taaklabels, OCR-modellen of externe tools, en werkt met Qwen2.5-VL- en LLaVA-1.5-modellen. Experimenten tonen aan dat met 80,2% tokenreductie (van 1296 naar 256), GMC 97,78% van de gemiddelde prestaties van het volledige model behoudt op benchmarks zoals TextVQA, ChartQA en MME. Met 90,1% reductie behoudt het 99,11%. Op LLaVA-1.5, met 128 en 64 tokens, behoudt het respectievelijk 99,76% en 99,82%. GMC vermindert ook visuele hallucinaties op POPE, AMBER en HallusionBench. In long-document QA behaalt het een 1,258x versnelling, vermindert het de KV-Cache met 73,94% en handhaaft het 98,87% van de antwoordkwaliteit. Het artikel is beschikbaar op arXiv.
Bron: QbitAI 量子位 —
origineel
