AraştırmaModeller 🇺🇸 27.07.2026 13:06

Latest innovations in LLM architectures: shared KV caches, per-layer embeddings, and compressed attention

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
New open LLMs increasingly focus on efficient long-context processing. Gemma 4 (Google) uses KV tensor sharing between layers to reduce cache size, as well as per-layer embeddings to improve parametric efficiency. Laguna XS.2 (Poolside) employs per-layer attention budgeting, and DeepSeek V4 introduces mHC and compressed attention mechanisms.
Bu makalede, uzun bağlamlarla çalışırken maliyetleri düşürmeyi amaçlayan açık kaynaklı LLM'lerdeki son mimari değişiklikler ele alınıyor. Google'ın Gemma 4 modelleri (E2B, E4B) paylaşımlı KV önbelleği kullanıyor: daha sonraki katmanlar, aynı dikkat türündeki önceki katmanların anahtar ve değerlerini yeniden kullanarak KV önbellek boyutunu yarıya indiriyor (örneğin, E2B için 128K bağlamda bfloat16 ile 2,7 GB tasarruf sağlanıyor). Ayrıca, E2B ve E4B varyantlarında katman başına gömme vektörleri kullanılıyor: her transformatör bloğu, ortak bir "paketlenmiş" tablodan küçük bir tokena özgü vektör alarak, ana bloklardaki parametre sayısında orantılı bir artış olmadan model kapasitesini artırıyor. Poolside'dan Laguna XS.2 modeli, katman başına dikkat bütçelemesi uyguluyor: 40 katmandan yalnızca 10'u tam (küresel) dikkat kullanırken, kalan 30 katman kayan pencere (512 token) kullanarak kaynak tasarrufu sağlıyor. Son olarak, DeepSeek V4, daha ileri optimizasyon için mHC ve sıkıştırılmış dikkat mekanizmalarını kullanıyor. Tüm bu teknikler, küçük iyileştirmeler gibi görünse de, uzun diziler işlenirken bellek ve hesaplama yükünü önemli ölçüde azaltıyor.
Kaynak: Sebastian Raschka — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler