InvestigaciónModelos 🇷🇺 27.07.2026 10:03

Token Cramming: la compresión de texto ideal no preserva el significado – Estudio AIRI

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Investigadores de AIRI demostraron que el método de token cramming, que comprime hasta 1568 tokens en una sola representación (embedding), no garantiza la preservación del significado: bajo decodificación voraz (greedy decoding), la precisión cae del 99,96% al 40%. Se propuso un nuevo método, progressive cramming, para lograr una reconstrucción al 100%, pero se descubrió que incluso una representación perfectamente comprimida afecta la capacidad de razonamiento del modelo, y la causa radica en las primeras capas del transformer.
Investigadores de AIRI estudiaron el método de compresión de tokens (token cramming), que comprime hasta 1.568 tokens en una única representación (embedding) de un LLM congelado, con una precisión de reconstrucción superior al 99%. Sin embargo, al pasar de teacher forcing al muestreo glotón (greedy decoding), la precisión cae al 40%, ya que los errores se concentran en los primeros tokens. Los autores propusieron el compresión progresiva (progressive cramming), que garantiza una reconstrucción del 100% añadiendo tokens de uno en uno de forma incremental. Con este método, midieron la capacidad de compresión de varios modelos: por ejemplo, Llama-3.1-8B comprime 1.438 tokens, y con proyección de baja dimensión, hasta 1.697. El estudio de las trayectorias de optimización mostró que estas se sitúan en un subespacio de baja dimensión (30-100 componentes). El resultado principal: incluso una representación perfectamente comprimida, cuando se alimenta junto con el prefijo original, reduce la precisión en HellaSwag (del 61,9% al 40,8% para Llama) y cae a cero en MMLU. La razón radica en las primeras capas del transformador: el knockout de atención reveló que las interacciones en las primeras capas son necesarias para la reconstrucción pero dificultan la comprensión. La capacidad de compresión aumenta monótonamente con la profundidad y anchura del modelo. También se descubrió que la dificultad de comprimir un token se predice por su sorpresa (surprisal).
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas