RechercheModèles 🇨🇳 12.08.2026 16:01

Zidong Taichu présente la méthode d'élagage des coresets GMC : conserve toute la capacité multimodale avec 80 % de jetons en moins

L'équipe du grand modèle Zidong Taichu de l'Institut d'Automatisation de l'Académie chinoise des sciences a développé GMC (Grounded Message Coreset Pruning), une méthode d'élagage des coresets sans entraînement qui réduit les jetons visuels jusqu'à 90 % tout en préservant plus de 99 % des performances moyennes du modèle. GMC répond à la redondance des jetons visuels dans les modèles vision-langage, offrant une solution enfichable compatible avec les modèles grand public comme Qwen et LLaVA.
L'équipe Zidong Taichu de l'Académie chinoise des sciences a présenté GMC (Grounded Message Coreset Pruning), une nouvelle méthode d'élagage de coreset pour les modèles vision-langage. Les jetons visuels sont souvent redondants, ce qui entraîne une utilisation élevée de la mémoire GPU et une inférence lente. Le filtrage traditionnel Top-K ne conserve que les jetons à score élevé, concentrés dans les régions saillantes, ce qui entraîne une perte d'information et des hallucinations visuelles. GMC utilise une architecture à deux étages : la sélection adaptative de preuves complémentaires et le transport de population. La première étape sélectionne les jetons clés en fonction de leur contribution à la couverture des preuves non couvertes, en tenant compte des aspects sémantiques, visuels et spatiaux. La deuxième étape agrège les états cachés des jetons supprimés dans des jetons représentatifs, préservant ainsi l'information sans entraînement. GMC est sans entraînement, ne nécessite pas d'étiquettes de tâches, de modèles OCR ni d'outils externes, et fonctionne avec les modèles Qwen2.5-VL et LLaVA-1.5. Les expériences montrent qu'avec une réduction de 80,2% des jetons (de 1296 à 256), GMC conserve 97,78% de la performance moyenne du modèle complet sur des références telles que TextVQA, ChartQA et MME. Avec une réduction de 90,1%, il conserve 99,11%. Sur LLaVA-1.5, avec 128 et 64 jetons, il conserve respectivement 99,76% et 99,82%. GMC réduit également les hallucinations visuelles sur POPE, AMBER et HallusionBench. Dans la question-réponse sur documents longs, il atteint une accélération de 1,258x, réduit le cache KV de 73,94% et maintient une qualité de réponse de 98,87%. L'article est disponible sur arXiv.
Source: QbitAI 量子位 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches