OnderzoekModellen 🇺🇸 27.07.2026 13:06

Nieuwste innovaties in LLM-architecturen: gedeelde KV-caches, per-laag embeddings en gecomprimeerde aandacht

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Nieuwe open LLM's richten zich steeds meer op efficiënte verwerking van lange contexten. Gemma 4 (Google) gebruikt KV-tensor-deling tussen lagen om de cachegrootte te verkleinen, evenals per-laag embeddings om de parametrische efficiëntie te verbeteren. Laguna XS.2 (Poolside) maakt gebruik van per-laag-aandachtsbudgettering, en DeepSeek V4 introduceert mHC en gecomprimeerde aandachtsmechanismen.
Het artikel bespreekt de recente architecturale veranderingen in open LLM's die gericht zijn op het verlagen van de kosten bij het werken met lange contexten. Googles Gemma 4-modellen (E2B, E4B) maken gebruik van een gedeelde KV-cache: latere lagen hergebruiken sleutels en waarden van eerdere lagen van hetzelfde aandachtstype, waardoor de grootte van de KV-cache wordt gehalveerd (bijvoorbeeld voor E2B in een context van 128K bespaart dit 2,7 GB bij bfloat16). Daarnaast worden in de E2B- en E4B-varianten per-laag embeddings (per-layer embeddings, PLE) toegepast: elk transformerblok krijgt een kleine token-specifieke vector uit een gedeelde 'verpakte' tabel, wat de modelcapaciteit vergroot zonder een proportionele toename van het aantal parameters in de hoofdblokken. Het Laguna XS.2-model van Poolside implementeert een per-laag budgettering van aandacht: van de 40 lagen hebben er slechts 10 volledige (globale) aandacht, terwijl de overige 30 een schuivend venster (512 tokens) gebruiken, wat middelen bespaart. Ten slotte gebruikt DeepSeek V4 de mechanismen mHC (multi-head compression) en gecomprimeerde aandacht voor verdere optimalisatie. Al deze technieken, hoewel ze lijken op kleine aanpassingen, verminderen de geheugen- en rekenbelasting aanzienlijk bij het verwerken van lange sequenties.
Bron: Sebastian Raschka — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws