PesquisaModelos 🇺🇸 27.07.2026 13:06

Últimas inovações em arquiteturas de LLM: caches KV compartilhados, embeddings por camada e atenção comprimida

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Novos LLMs abertos focam cada vez mais no processamento eficiente de contextos longos. O Gemma 4 (Google) usa compartilhamento de tensores KV entre camadas para reduzir o tamanho do cache, além de embeddings por camada para melhorar a eficiência paramétrica. O Laguna XS.2 (Poolside) emprega orçamento de atenção por camada, e o DeepSeek V4 introduz mecanismos de mHC e atenção comprimida.
O artigo discute as mudanças arquiteturais mais recentes em LLMs abertos, voltadas à redução de custos no processamento de contexto longo. Os modelos Gemma 4 do Google (E2B, E4B) usam cache KV compartilhado: camadas posteriores reutilizam chaves e valores de camadas anteriores do mesmo tipo de atenção, reduzindo pela metade o tamanho do cache KV (por exemplo, para E2B em contexto de 128K, a economia é de 2,7 GB com bf16). Além disso, nas variantes E2B e E4B são aplicados embeddings por camada (per-layer embeddings, PLE): cada bloco transformer recebe um pequeno vetor específico de token de uma tabela "empacotada" central, aumentando a capacidade do modelo sem crescimento proporcional de parâmetros nos blocos principais. O modelo Laguna XS.2 da Poolside implementa orçamento de atenção por camada: dos 40 layers, apenas 10 têm atenção global (completa), enquanto os 30 restantes usam janela deslizante (512 tokens), economizando recursos. Por fim, o DeepSeek V4 utiliza mecanismos mHC (multi-head compression) e atenção comprimida para otimização adicional. Todas essas técnicas, embora pareçam pequenos ajustes, reduzem significativamente a carga de memória e computação ao processar sequências longas.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas