TutkimusMallit 🇨🇳 12.08.2026 16:01

Zidong Taichu esittelee GMC Coreset -karsintamenetelmän: säilyttää täyden multimodaalisen kyvykkyyden 80 prosenttia vähemmällä tokeneiden määrällä

Kiinan tiedeakatemian automaatioinstituutin Zidong Taichu -suurkielimallitiimi on kehittänyt GMC (Grounded Message Coreset Pruning) -menetelmän, joka on koulutusta vaatimaton coreset-karsintamenetelmä ja vähentää visuaalisten tokeneiden määrää jopa 90 prosenttia säilyttäen samalla yli 99 prosenttia mallin keskimääräisestä suorituskyvystä. GMC käsittelee visuaalisten tokeneiden redundanssia visio-kielimalleissa ja tarjoaa plug-and-play-ratkaisun, joka on yhteensopiva valtavirran mallien, kuten Qwenin ja LLaVA:n, kanssa.
Kiinan tiedeakatemian Zidong Taichu -tiimi on esitellyt GMC:n (Grounded Message Coreset Pruning), uuden coreset-karsintamenetelmän visio-kielimalleille. Visuaaliset tokenit ovat usein redundantteja, mikä aiheuttaa suurta GPU-muistin käyttöä ja hidasta päättelyä. Perinteinen Top-K-tokenisuodatus säilyttää vain korkean pistemäärän tokeneita, jotka keskittyvät näkyville alueille, mikä johtaa informaation menetykseen ja visuaalisiin hallusinaatioihin. GMC käyttää kaksivaiheista arkkitehtuuria: komplementaarisen evidenssin adaptiivinen valinta ja populaation kuljetus. Ensimmäinen vaihe valitsee avaintokenit niiden panoksen perusteella peittämättömän evidenssin kattamiseen, ottaen huomioon semanttiset, visuaaliset ja spatiaaliset näkökohdat. Toinen vaihe aggregoi poistettujen tokenien piilotetut tilat edustaviin tokeneihin, säilyttäen informaation ilman harjoitusta. GMC on harjoituksesta riippumaton, ei vaadi tehtävämerkintöjä, OCR-malleja tai ulkoisia työkaluja, ja toimii Qwen2.5-VL- ja LLaVA-1.5-mallien kanssa. Kokeet osoittavat, että 80,2 %:n token-vähennyksellä (1296:sta 256:een) GMC säilyttää 97,78 % täyden mallin keskimääräisestä suorituskyvystä vertailuarvoissa kuten TextVQA, ChartQA ja MME. 90,1 %:n vähennyksellä se säilyttää 99,11 %. LLaVA-1.5:ssä, 128 ja 64 tokenilla, se säilyttää 99,76 % ja 99,82 % vastaavasti. GMC vähentää myös visuaalisia hallusinaatioita POPE-, AMBER- ja HallusionBench-vertailuarvoissa. Pitkän dokumentin kysely-vastauksessa se saavuttaa 1,258-kertaisen nopeutuksen, vähentää KV-välimuistia 73,94 % ja ylläpitää 98,87 %:n vastauksen laadun. Paperi on saatavilla arXiv-palvelussa.
Lähde: QbitAI 量子位 — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset