Últimas innovaciones en arquitecturas de LLM: cachés KV compartidas, embeddings por capa y atención comprimida
Los nuevos LLM abiertos se centran cada vez más en el procesamiento eficiente de contextos largos. Gemma 4 (de Google) utiliza el uso compartido de tensores KV entre capas para reducir el tamaño de la caché, así como embeddings por capa para mejorar la eficiencia paramétrica. Laguna XS.2 (de Poolside) emplea un presupuesto de atención por capa, y DeepSeek V4 introduce mecanismos de mHC y atención comprimida.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute





