Últimas inovações em arquiteturas de LLM: caches KV compartilhados, embeddings por camada e atenção comprimida
Novos LLMs abertos focam cada vez mais no processamento eficiente de contextos longos. O Gemma 4 (Google) usa compartilhamento de tensores KV entre camadas para reduzir o tamanho do cache, além de embeddings por camada para melhorar a eficiência paramétrica. O Laguna XS.2 (Poolside) emprega orçamento de atenção por camada, e o DeepSeek V4 introduz mecanismos de mHC e atenção comprimida.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute





