Token Cramming: Compressão de Texto Ideal Não Preserva Significado – Estudo AIRI
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Pesquisadores da AIRI demonstraram que o método token cramming, que comprime até 1568 tokens em um único embedding, não garante a preservação do significado: sob decodificação gulosa, a precisão cai de 99,96% para 40%. Um novo método, progressive cramming, foi proposto para alcançar reconstrução de 100%, mas descobriu-se que mesmo um embedding perfeitamente comprimido prejudica a capacidade de raciocínio do modelo, e a causa reside nas camadas iniciais do transformador.
Pesquisadores da AIRI estudaram o método de compactação de tokens, que comprime até 1.568 tokens em uma única incorporação (embedding) de um modelo de linguagem grande (LLM, na sigla em inglês) congelado, com precisão de reconstrução superior a 99%. No entanto, ao transitar de teacher forcing para decodificação gulosa (greedy decoding), a precisão cai para 40%, pois os erros se concentram nos primeiros tokens. Os autores propuseram a compactação progressiva, que garante 100% de reconstrução ao adicionar tokens incrementalmente, um por um. Usando esse método, mediram a capacidade de compactação de vários modelos: por exemplo, o Llama-3.1-8B comprime 1.438 tokens e, com projeção de baixa dimensão, até 1.697. O estudo das trajetórias de otimização mostrou que elas se situam em um subespaço de baixa dimensão (30 a 100 componentes). O principal resultado: mesmo uma incorporação perfeitamente comprimida, quando alimentada junto com o prefixo original, reduz a precisão no HellaSwag (de 61,9% para 40,8% para o Llama) e cai para zero no MMLU. A razão está nas primeiras camadas do transformer: o knockout de atenção revelou que as interações nas primeiras camadas são necessárias para a reconstrução, mas prejudicam a compreensão. A capacidade de compactação aumenta monotonamente com a profundidade e largura do modelo. Também foi descoberto que a dificuldade de comprimir um token é prevista por sua surpresa (surprisal).
Fonte: Habr — хаб ИИ —
original
