Dernières innovations dans les architectures de LLM : caches KV partagés, embeddings par couche et attention compressée
Les nouveaux LLM open source se concentrent de plus en plus sur un traitement efficace des longs contextes. Gemma 4 (Google) utilise le partage des tenseurs KV entre les couches pour réduire la taille du cache, ainsi que des embeddings par couche pour améliorer l'efficacité paramétrique. Laguna XS.2 (Poolside) emploie une budgétisation de l'attention par couche, et DeepSeek V4 introduit les mécanismes mHC et d'attention compressée.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute






