Investigación 🇷🇺 27.07.2026 10:03

Token Cramming: la compresión perfecta de texto no preserva el significado – Estudio AIRI

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Investigadores de AIRI (FusionBrain) identificaron problemas críticos con el método token cramming, que permite empaquetar miles de tokens en una sola incrustación. Resultó que incluso con una precisión de reconstrucción del 99.96%, el modelo pierde su capacidad de razonar sobre el texto comprimido. Se propuso un nuevo protocolo llamado progressive cramming, que garantiza una reconstrucción del 100% pero muestra que la recuperación del texto no equivale a comprensión.
Un equipo de investigadores del laboratorio FusionBrain AIRI, liderado por Dmitry Tarasov, presentó en ICML 2026 un trabajo en el que se analiza críticamente el método token cramming, que consiste en comprimir cientos y miles de tokens de texto en un único embedding de entrada de un LLM congelado. Anteriormente, un trabajo del colega Yuri Kuratov (AIRI) mostró que se podían "empaquetar" hasta 1568 tokens en un solo vector con una precisión de reconstrucción del 99,96% utilizando teacher forcing. Sin embargo, el nuevo análisis reveló que los errores se concentran en las primeras posiciones, lo que resulta fatal para la generación autorregresiva: con decodificación greedy, la precisión cae al 40% para Llama-3.1-8B. Los autores propusieron el método progressive cramming, que incrementa la longitud del prefijo token a token, garantizando una reconstrucción del 100% en cada paso. Con este método se midió la capacidad de diferentes modelos: Llama-3.1-8B comprime en promedio 1438 tokens, Pythia-1.4B 430, SmolLM2-1.7B 335 y Gemma-3-4B 214. La aplicación de proyección de baja dimensión aumenta la capacidad entre 1.2 y 3.3 veces. El estudio de las trayectorias de optimización mostró que el camino del optimizador en el espacio de embeddings se encuentra en un subespacio de baja dimensión (30-100 componentes), aunque el conjunto de soluciones es de alta dimensión. El resultado principal: la reconstrucción perfecta no garantiza la preservación del significado. Agregar el embedding comprimido al contexto reduce la precisión en HellaSwag y ARC-Easy (por ejemplo, para Llama-3.1-8B del 61.9% al 40.8% en HellaSwag), y en MMLU con 5 ejemplos la precisión cae casi a cero. La razón está en las capas tempranas del transformador: silenciar la atención al embedding en las capas tempranas restaura la capacidad de razonamiento. La capacidad de compresión aumenta con la profundidad y el ancho del modelo; para SmolLM2, las primeras 8 capas comprimen más que el modelo completo.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas