⚡ SON DAKİKA
LLM Mimarisi Yenilikleri: KV Paylaşımı, Katman Başına Gömme ve Sıkıştırılmış Dikkat
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka, uzun bağlam verimliliğine odaklanan son açık ağırlıklı LLM mimarisi gelişmelerini inceliyor. Temel teknikler arasında katmanlar arası KV paylaşımı (Gemma 4), katman başına gömmeler (Gemma 4 E2B/E4B), katman bazında dikkat bütçelemesi (Laguna XS.2), sıkıştırılmış konvolüsyonel dikkat (ZAYA1) ve sıkıştırılmış dikkat ile mHC (DeepSeek V4) yer alıyor. Bunlar, akıl yürütme ve ajan iş akışları için KV önbellek boyutunu ve bellek trafiğini azaltıyor.
Sebastian Raschka, uzun bağlam maliyetlerini azaltmayı amaçlayan yakın tarihli açık ağırlıklı LLM mimarisi değişikliklerini inceliyor. Gemma 4 E2B/E4B'de, sonraki katmanlar önceki katmanlardaki anahtar-değer durumlarını yeniden kullanıyor (çapraz katman dikkati), bu da KV önbellek boyutunun yaklaşık yarısını (örneğin, 128K bağlamda 2.7 GB) kurtarıyor. Ek olarak, bu modeller ana transformer yığınını genişletmeden kapasiteyi artırmak için katman başına yerleştirmeler (Ing. per-layer embeddings, PLE) kullanıyor—'etkin' parametre sayısı, yerleştirmeler dahil toplamdan daha küçük. Poolside tarafından geliştirilen Laguna XS.2, katman başına dikkat maliyetini değiştiriyor; 30 kayan pencere (pencere 512) ve 10 tam dikkat katmanı içeriyor. ZAYA1-8B, sıkıştırılmış evrişimli dikkat sunarken, DeepSeek V4, mHC ve sıkıştırılmış dikkat kullanıyor. Bu değişiklikler, akıl yürütme modelleri ve ajan iş akışlarında verimli uzun bağlam işlemeye yönelik artan ihtiyaçtan kaynaklanıyor.
Kaynak: Sebastian Raschka —
orijinal
