⚡ عاجل
الأبحاثالنماذج 🇺🇸 27.07.2026 13:06

ابتكارات في بنية نماذج اللغات الكبيرة: مشاركة KV، تضمينات لكل طبقة، وانتباه مضغوط

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
يستعرض سيباستيان راشكا التطورات الحديثة في بنية نماذج اللغات الكبيرة مفتوحة الوزن، مع التركيز على كفاءة السياقات الطويلة. تشمل التقنيات الرئيسية مشاركة KV عبر الطبقات (Gemma 4)، التضمينات لكل طبقة (Gemma 4 E2B/E4B)، تخصيص الانتباه لكل طبقة (Laguna XS.2)، الانتباه التلافيفي المضغوط (ZAYA1)، وmHC مع الانتباه المضغوط (DeepSeek V4). تعمل هذه الابتكارات على تقليل حجم ذاكرة التخزين المؤقت لـ KV وحركة البيانات للاستدلال وسير عمل العوامل.
يستعرض سيباستيان راشكا أحدث التغييرات في بنية نماذج اللغة مفتوحة الأوزان التي تهدف إلى تقليل تكاليف السياقات الطويلة. في نموذج Gemma 4 E2B/E4B، تعيد الطبقات اللاحقة استخدام حالات المفاتيح والقيم من الطبقات السابقة (الانتباه عبر الطبقات)، مما يوفر حوالي نصف حجم ذاكرة التخزين المؤقت للمفاتيح والقيم (على سبيل المثال، 2.7 جيجابايت عند سياق بطول 128 ألف رمز). بالإضافة إلى ذلك، تستخدم هذه النماذج تضمينات لكل طبقة (PLE) لزيادة السعة دون توسيع كومة المحول الرئيسية—حيث أن عدد المعاملات 'الفعال' أصغر من الإجمالي بما في ذلك التضمينات. نموذج Laguna XS.2 من شركة Poolside يغير تكلفة الانتباه حسب الطبقة، حيث يحتوي على 30 طبقة انتباه بنافذة منزلقة (باستخدام نافذة بحجم 512) و10 طبقات انتباه كامل. يقدم نموذج ZAYA1-8B انتباهاً تلافيفياً مضغوطاً، بينما يستخدم DeepSeek V4 تقنيتي mHC والانتباه المضغوط. هذه التعديلات مدفوعة بالحاجة المتزايدة لمعالجة السياقات الطويلة بكفاءة في نماذج الاستدلال وسير عمل الوكلاء.
المصدر: Sebastian Raschka — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة