Zidong Taichu presenta el método GMC Coreset Pruning: conserva toda la capacidad multimodal con un 80% menos de tokens
El equipo del modelo grande Zidong Taichu del Instituto de Automatización de la Academia China de Ciencias ha desarrollado GMC (Grounded Message Coreset Pruning), un método de poda de núcleos (coreset) sin entrenamiento que reduce los tokens visuales hasta en un 90% mientras preserva más del 99% del rendimiento promedio del modelo. GMC aborda la redundancia de los tokens visuales en los modelos de visión y lenguaje, ofreciendo una solución plug-and-play compatible con modelos populares como Qwen y LLaVA.
El equipo Zidong Taichu de la Academia China de Ciencias ha presentado GMC (Poda de Conjuntos Centrales con Mensajes Fundamentados), un novedoso método de poda de conjuntos centrales para modelos de visión y lenguaje. Los tokens visuales suelen ser redundantes, lo que provoca un alto uso de memoria GPU y una inferencia lenta. El filtrado tradicional de tokens Top-K conserva únicamente los tokens con mayor puntuación, que se concentran en regiones salientes, lo que conduce a una pérdida de información y a alucinaciones visuales. GMC utiliza una arquitectura de doble etapa: selección adaptativa de evidencia complementaria y transporte de población. La primera etapa selecciona tokens clave basándose en su contribución a cubrir evidencia no descubierta, considerando aspectos semánticos, visuales y espaciales. La segunda etapa agrega los estados ocultos de los tokens eliminados en los tokens representativos, preservando la información sin necesidad de entrenamiento. GMC no requiere entrenamiento, no necesita etiquetas de tareas, modelos OCR ni herramientas externas, y funciona con los modelos Qwen2.5-VL y LLaVA-1.5. Los experimentos muestran que con una reducción del 80,2% de tokens (de 1296 a 256), GMC conserva el 97,78% del rendimiento promedio del modelo completo en puntos de referencia como TextVQA, ChartQA y MME. Con una reducción del 90,1%, conserva el 99,11%. En LLaVA-1.5, con 128 y 64 tokens, conserva el 99,76% y el 99,82% respectivamente. GMC también reduce las alucinaciones visuales en POPE, AMBER y HallusionBench. En la pregunta-respuesta de documentos largos, logra una aceleración de 1.258 veces, reduce la caché KV en un 73,94% y mantiene el 98,87% de la calidad de las respuestas. El artículo está disponible en arXiv.
Fuente: QbitAI 量子位 —
original
