محولات هجينة تحت الحمل: أين يخسر Gated DeltaNet أمام الانتباه الكامل

اختبر مهندس نموذجين من Qwen، أحدهما بانتباه كامل والآخر ببنية هجينة تستخدم Gated DeltaNet، تحت حمل وكيل على RTX 3090. يفوز النموذج الهجين في السياقات الطويلة والتزامن العالي لكنه يخسر في الحوارات القصيرة مع أنظمة برومبت مشتركة. المشكلة الرئيسية هي قفز حجم كتلة الذاكرة المؤقتة إلى 528 رمزًا، مما يقلل معدلات الإصابة بالذاكرة المؤقتة للبادئة ويجبر على إعادة حساب ثلث البرومبت.
النموذج الهجين Qwen3.5-4B يستخدم الانتباه الكامل في 8 طبقات فقط من أصل 32 طبقة، مع 24 طبقة متكررة من نوع Gated DeltaNet تحافظ على حالة بحجم ثابت بدلاً من زيادة ذاكرة التخزين المؤقت للمفاتيح والقيم. تحت حمل وكيل اصطناعي على بطاقة RTX 3090 واحدة مع vLLM 0.26.0، أظهر النموذج الهجين نسبة نجاح تبلغ 84% في ذاكرة التخزين المؤقت للبادئات مقارنة بنسبة 94% للنموذج Qwen3-4B ذي الانتباه الكامل، وأعاد حساب عدد من رموز المطالبة يزيد بثلاث مرات. السبب الجذري هو أن صفحات الحالة المتكررة وصفحات الانتباه للمفاتيح والقيم تتشارك في مجموعة مشتركة، مما يجبر حجم صفحة الانتباه على مطابقة حجم صفحة الحالة، مما يرفع حجم الكتلة من 16 إلى 528 رمزًا. وهذا يقلل من دقة مطابقة البادئات ويزيد من إعادة الحساب. يتمتع النموذج الهجين بالفعل بسعة ذاكرة تخزين مؤقت فعلية أكبر بمقدار 3.2 ضعفًا (297,720 رمزًا مقابل 93,408 رموز)، ولكن بتكلفة ذاكرة أقل بمقدار 2.6 جيجابايت للذاكرة المؤقتة وتفعيلات أكبر بمقدار 2.3 ضعفًا. كما أن الحجم الأكبر للكتلة يزيد من تكلفة الذاكرة لكل رمز للقطات الحالة عند تمكين الالتقاط الكامل للحالة.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة