LLM-Architektur-Innovationen: KV-Sharing, Embeddings pro Schicht und komprimierte Aufmerksamkeit
Sebastian Raschka gibt einen Überblick über aktuelle Fortschritte bei Open-Weight-LLM-Architekturen, die sich auf die Effizienz langer Kontexte konzentrieren. Zu den wichtigsten Techniken gehören KV-Sharing über Schichten hinweg (Gemma 4), Embeddings pro Schicht (Gemma 4 E2B/E4B), schichtweise Aufmerksamkeitsbudgetierung (Laguna XS.2), komprimierte convolutional attention (ZAYA1) sowie mHC mit komprimierter Aufmerksamkeit (DeepSeek V4). Diese reduzieren die KV-Cache-Größe und den Speicherverkehr für Reasoning- und Agent-Workflows.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute

