сохраняет только токены с наивысшими оценками, которые сосредоточены в наиболее значимых областях изображения, что ведёт к потере информации и визуальным галлюцинациям. GMC использует двухэтапную архитектуру: адаптивный отбор дополняющих доказательств и транспортировку популяции. На первом этапе выбираются ключевые токены на основе их вклада в покрытие ещё не охваченных доказательств с учётом семантических, визуальных и пространственных аспектов. На втором этапе скрытые состояния удалённых токенов агрегируются в репрезентативные, что позволяет сохранить информацию без дообучения. GMC не требует обучения, меток задач, моделей оптического распознавания символов (OCR) или внешних инструментов и работает с моделями Qwen2.5-VL и LLaVA-1.5. Эксперименты показывают, что при сокращении числа токенов на 80,2% (с 1296 до 256) GMC сохраняет 97,78% средней производительности полной модели на таких бенчмарках, как TextVQA, ChartQA и MME. При сокращении на 90,1% сохраняется 99,11%. На LLaVA-1.5 при 128 и 64 токенах сохраняется 99,76% и 99,82% соответственно. GMC также снижает количество визуальных галлюцинаций на POPE, AMBER и HallusionBench. В задачах ответов на вопросы (QA) по длинным документам метод обеспечивает ускорение в 1,258 раза, сокращает KV-кэш на 73,94% и сохраняет 98,87% качества ответов. Статья доступна на arXiv.