أحدث الابتكارات في بنى نماذج اللغة الكبيرة: خوادم KV المشتركة، تمثيلات لكل طبقة، والانتباه المضغوط
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
تركز نماذج اللغة الكبيرة مفتوحة المصدر الجديدة بشكل متزايد على المعالجة الفعالة للسياقات الطويلة. تستخدم Gemma 4 من Google مشاركة موتر KV بين الطبقات لتقليل حجم الخادم، بالإضافة إلى تمثيلات لكل طبقة لتحسين الكفاءة البارامترية. يستخدم Laguna XS.2 من Poolside توزيع ميزانية الانتباه لكل طبقة، ويقدم DeepSeek V4 آليات mHC والانتباه المضغوط.
تتناول المقالة أحدث التغييرات المعمارية في نماذج اللغة الكبيرة مفتوحة المصدر (LLM) التي تهدف إلى تقليل التكاليف عند العمل بسياقات طويلة. تستخدم نماذج Gemma 4 من Google (E2B، E4B) ذاكرة تخزين مؤقت مشتركة لقيم المفاتيح (KV cache): حيث تعيد الطبقات اللاحقة استخدام المفاتيح والقيم من الطبقات السابقة من نفس نوع الانتباه، مما يقلل حجم ذاكرة التخزين المؤقت KV إلى النصف (على سبيل المثال، بالنسبة لـ E2B في سياق 128 ألف رمز، يبلغ التوفير 2.7 جيجابايت عند استخدام bfloat16). بالإضافة إلى ذلك، في نسختي E2B و E4B، تُستخدم تضمينات لكل طبقة (per-layer embeddings، PLE): حيث يتلقى كل كتلة محول متجهًا صغيرًا خاصًا بالرمز من جدول «مضغوط» مشترك، مما يزيد من سعة النموذج دون زيادة متناسبة في عدد المعلمات في الكتل الرئيسية. ينفذ نموذج Laguna XS.2 من Poolside تحديد ميزانية الانتباه لكل طبقة: من بين 40 طبقة، يوجد فقط 10 طبقات ذات انتباه كامل (عالمي)، بينما تستخدم الـ 30 طبقة المتبقية نافذة منزلقة (512 رمزًا)، مما يوفر الموارد. أخيرًا، يستخدم DeepSeek V4 آليات ضغط الرؤوس المتعددة (mHC) والانتباه المضغوط لزيادة التحسين. جميع هذه التقنيات، على الرغم من أنها تبدو تحسينات طفيفة، تقلل بشكل كبير من الحمل على الذاكرة والحوسبة عند معالجة التسلسلات الطويلة.
المصدر: Sebastian Raschka —
الأصلي
