Zidong Taichu stellt GMC Coreset Pruning vor: Behält volle multimodale Fähigkeiten bei 80% weniger Tokens
Das Zidong-Taichu-Großmodellteam am Institut für Automatisierung der Chinesischen Akademie der Wissenschaften hat GMC (Grounded Message Coreset Pruning) entwickelt, eine trainingsfreie Coreset-Pruning-Methode, die visuelle Tokens um bis zu 90% reduziert und dabei über 99% der durchschnittlichen Leistung des Modells erhält. GMC adressiert die Redundanz visueller Tokens in Vision-Language-Modellen und bietet eine Plug-and-Play-Lösung, die mit gängigen Modellen wie Qwen und LLaVA kompatibel ist.
Das Zidong-Taichu-Team der Chinesischen Akademie der Wissenschaften hat GMC (Grounded Message Coreset Pruning) vorgestellt, eine neuartige Methode zum Beschneiden von Coresets für Vision-Language-Modelle. Visuelle Tokens sind oft redundant, was zu hohem GPU-Speicherverbrauch und langsamer Inferenz führt. Traditionelles Top-K-Token-Filtern behält nur Tokens mit hoher Punktzahl bei, die sich in markanten Bereichen konzentrieren, was zu Informationsverlust und visuellen Halluzinationen führt. GMC verwendet eine zweistufige Architektur: komplementäre evidenzadaptive Auswahl und Populationstransport. Die erste Stufe wählt Schlüsseltokens basierend auf ihrem Beitrag zur Abdeckung nicht abgedeckter Evidenz aus und berücksichtigt dabei semantische, visuelle und räumliche Aspekte. Die zweite Stufe aggregiert versteckte Zustände gelöschter Tokens in repräsentative Tokens, wodurch Informationen ohne Training erhalten bleiben. GMC ist trainingsfrei, benötigt keine Aufgabenlabels, OCR-Modelle oder externe Werkzeuge und funktioniert mit Qwen2.5-VL- und LLaVA-1.5-Modellen. Experimente zeigen, dass GMC bei einer Tokenreduktion von 80,2 Prozent (von 1296 auf 256) 97,78 Prozent der durchschnittlichen Leistung des vollständigen Modells bei Benchmarks wie TextVQA, ChartQA und MME beibehält. Bei einer Reduktion von 90,1 Prozent bleiben 99,11 Prozent erhalten. Bei LLaVA-1.5 bleiben mit 128 und 64 Tokens 99,76 Prozent bzw. 99,82 Prozent erhalten. GMC reduziert auch visuelle Halluzinationen auf POPE, AMBER und HallusionBench. Bei Langdokument-QA erreicht es eine Beschleunigung um den Faktor 1,258, reduziert den KV-Cache um 73,94 Prozent und behält 98,87 Prozent der Antwortqualität bei. Das Papier ist auf arXiv verfügbar.
Quelle: QbitAI 量子位 —
Original
