⚡ ÚLTIMA HORA
Inovações na Arquitetura de LLMs: Compartilhamento de KV, Embeddings por Camada e Atenção Comprimida
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka analisa os avanços recentes em arquiteturas de LLMs de peso aberto com foco em eficiência de contexto longo. As principais técnicas incluem compartilhamento de KV entre camadas (Gemma 4), embeddings por camada (Gemma 4 E2B/E4B), orçamento de atenção por camada (Laguna XS.2), atenção convolucional comprimida (ZAYA1) e mHC com atenção comprimida (DeepSeek V4). Essas reduzem o tamanho do cache KV e o tráfego de memória para workflows de raciocínio e agentes.
Sebastian Raschka analisa mudanças recentes na arquitetura de modelos de linguagem abertos (open-weight LLMs) visando reduzir custos de contexto longo. No Gemma 4 E2B/E4B, camadas posteriores reutilizam estados de chave-valor de camadas anteriores (atenção entre camadas), economizando cerca de metade do tamanho do cache KV (por exemplo, 2,7 GB em contexto de 128K). Além disso, esses modelos usam embeddings por camada (PLEs, do inglês per-layer embeddings) para aumentar a capacidade sem expandir a pilha principal do transformador—a contagem 'efetiva' de parâmetros é menor que o total incluindo embeddings. O Laguna XS.2 da Poolside varia o custo de atenção por camada, com 30 camadas de janela deslizante (janela de 512) e 10 camadas de atenção total. O ZAYA1-8B introduz atenção convolucional comprimida, e o DeepSeek V4 emprega mHC e atenção comprimida. Essas otimizações são motivadas pela crescente necessidade de processamento eficiente de contexto longo em modelos de raciocínio e fluxos de trabalho de agentes.
Fonte: Sebastian Raschka —
original
