शोधमॉडल 🇺🇸 27.07.2026 13:06

Latest innovations in LLM architectures: shared KV caches, per-layer embeddings, and compressed attention

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
New open LLMs increasingly focus on efficient long-context processing. Gemma 4 (Google) uses KV tensor sharing between layers to reduce cache size, as well as per-layer embeddings to improve parametric efficiency. Laguna XS.2 (Poolside) employs per-layer attention budgeting, and DeepSeek V4 introduces mHC and compressed attention mechanisms.
लेख में लंबे संदर्भ के साथ काम करते समय लागत कम करने के उद्देश्य से खुले LLM में नवीनतम वास्तुशिल्प परिवर्तनों पर चर्चा की गई है। Google के Gemma 4 मॉडल (E2B, E4B) साझा KV कैश का उपयोग करते हैं: बाद की परतें उसी प्रकार के अटेंशन की पिछली परतों से कुंजियों और मानों का पुन: उपयोग करती हैं, जिससे KV कैश का आकार आधा हो जाता है (उदाहरण के लिए, E2B के लिए 128K संदर्भ में bfloat16 के साथ 2.7 GB की बचत होती है)। इसके अतिरिक्त, E2B और E4B वेरिएंट्स में per-layer embeddings (PLE) का उपयोग किया जाता है: प्रत्येक ट्रांसफॉर्मर ब्लॉक को एक सामान्य "पैक्ड" टेबल से एक छोटा टोकन-विशिष्ट वेक्टर मिलता है, जो मुख्य ब्लॉकों में पैरामीटर संख्या में आनुपातिक वृद्धि के बिना मॉडल की क्षमता को बढ़ाता है। Poolside का Laguna XS.2 मॉडल per-layer अटेंशन बजटिंग लागू करता है: 40 परतों में से केवल 10 में पूर्ण (ग्लोबल) अटेंशन होता है, जबकि शेष 30 में स्लाइडिंग विंडो (512 टोकन) होती है, जिससे संसाधनों की बचत होती है। अंत में, DeepSeek V4 आगे अनुकूलन के लिए mHC (मल्टी-हेड कंप्रेशन) और संपीड़ित अटेंशन तंत्र का उपयोग करता है। ये सभी तकनीकें, भले ही छोटे संशोधनों की तरह दिखें, लंबे अनुक्रमों के प्रसंस्करण के दौरान मेमोरी और कंप्यूटेशन लोड को काफी कम करती हैं।
स्रोत: Sebastian Raschka — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार