Neueste Innovationen in LLM-Architekturen: gemeinsame KV-Caches, schichtweise Embeddings und komprimierte Aufmerksamkeit
Neue offene LLMs konzentrieren sich zunehmend auf effiziente Verarbeitung langer Kontexte. Gemma 4 (Google) verwendet KV-Tensor-Sharing zwischen Schichten, um die Cache-Größe zu reduzieren, sowie schichtweise Embeddings zur Verbesserung der parametrischen Effizienz. Laguna XS.2 (Poolside) setzt auf schichtweise Aufmerksamkeitsbudgetierung, und DeepSeek V4 führt mHC und komprimierte Aufmerksamkeitsmechanismen ein.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute






