Pesquisa 🇷🇺 27.07.2026 10:03

Compactação de Tokens: Compressão Perfeita de Texto Não Preserva o Significado – Estudo da AIRI

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Pesquisadores da AIRI (FusionBrain) identificaram problemas críticos com o método de compactação de tokens, que permite empacotar milhares de tokens em uma única incorporação (embedding). Descobriu-se que, mesmo com 99,96% de precisão na reconstrução, o modelo perde a capacidade de raciocinar sobre o texto comprimido. Um novo protocolo chamado compactação progressiva foi proposto, garantindo 100% de reconstrução, mas mostrando que a recuperação do texto não equivale à compreensão.
Um grupo de pesquisadores do laboratório FusionBrain AIRI, liderado por Dmitry Tarasov, apresentou um trabalho na ICML 2026 que analisa criticamente o método token cramming — compressão de centenas e milhares de tokens de texto em um único embedding de entrada de um modelo de linguagem grande (large language model, LLM) congelado. Anteriormente, um trabalho do colega Yuri Kuratov (AIRI) mostrou que é possível "empacotar" até 1568 tokens em um único vetor com precisão de reconstrução de 99,96% usando teacher forcing. No entanto, a nova análise revelou que os erros se concentram nas primeiras posições, o que é fatal para a geração autoregressiva: com decodificação greedy, a precisão cai para 40% para o Llama-3.1-8B. Os autores propuseram o método progressive cramming, que aumenta o comprimento do prefixo um token por vez, garantindo 100% de reconstrução a cada passo. Usando esse método, a capacidade de diferentes modelos foi medida: Llama-3.1-8B comprime em média 1438 tokens, Pythia-1.4B comprime 430, SmolLM2-1.7B comprime 335, e Gemma-3-4B comprime 214. A aplicação de projeção de baixa dimensão aumenta a capacidade em 1,2 a 3,3 vezes. O estudo das trajetórias de otimização mostrou que o caminho do otimizador no espaço de embeddings reside em um subespaço de baixa dimensão (30–100 componentes), embora o conjunto de soluções seja de alta dimensão. O principal resultado: a reconstrução perfeita não garante a preservação do significado. Adicionar o embedding comprimido ao contexto reduz a precisão no HellaSwag e no ARC-Easy (por exemplo, para o Llama-3.1-8B, de 61,9% para 40,8% no HellaSwag), e no MMLU com 5 disparos (5-shot MMLU), a precisão cai para quase zero. A razão está nas camadas iniciais do transformador: silenciar a atenção ao embedding nas camadas iniciais restaura a capacidade de raciocínio. A capacidade de compressão aumenta com a profundidade e largura do modelo; para o SmolLM2, as 8 primeiras camadas comprimem mais do que o modelo completo.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas