Nieuwste innovaties in LLM-architecturen: gedeelde KV-caches, per-laag embeddings en gecomprimeerde aandacht
Nieuwe open LLM's richten zich steeds meer op efficiënte verwerking van lange contexten. Gemma 4 (Google) gebruikt KV-tensor-deling tussen lagen om de cachegrootte te verkleinen, evenals per-laag embeddings om de parametrische efficiëntie te verbeteren. Laguna XS.2 (Poolside) maakt gebruik van per-laag-aandachtsbudgettering, en DeepSeek V4 introduceert mHC en gecomprimeerde aandachtsmechanismen.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute





