ابتكارات في بنية نماذج اللغات الكبيرة: مشاركة KV، تضمينات لكل طبقة، وانتباه مضغوط
يستعرض سيباستيان راشكا التطورات الحديثة في بنية نماذج اللغات الكبيرة مفتوحة الوزن، مع التركيز على كفاءة السياقات الطويلة. تشمل التقنيات الرئيسية مشاركة KV عبر الطبقات (Gemma 4)، التضمينات لكل طبقة (Gemma 4 E2B/E4B)، تخصيص الانتباه لكل طبقة (Laguna XS.2)، الانتباه التلافيفي المضغوط (ZAYA1)، وmHC مع الانتباه المضغوط (DeepSeek V4). تعمل هذه الابتكارات على تقليل حجم ذاكرة التخزين المؤقت لـ KV وحركة البيانات للاستدلال وسير عمل العوامل.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute



