MoE على RTX 5090 يقصر بنسبة 1.5 مرة، ليس بسبب التوجيه
يكشف اختبار مفصّل على RTX 5090 أن نموذج خليط الخبراء (Qwen3.5-35B-A3B) يستخدم 41% فقط من عرض النطاق الترددي لذاكرة وحدة معالجة الرسوميات، بينما يحقق النموذج الكثيف (Qwen3.5-9B) نسبة 72%. السبب الجذري هو عدم كفاية البايتات المقروءة لكل استدعاء للنواة، وليس توجيه الخبراء. يتنبأ المؤلف بالأداء لنموذج آخر وعبر أعماق السياق بدقة عالية.
قام المؤلف بقياس أداء معالج RTX 5090 باستخدام llama.cpp الإصدار b10326 مع تكميم Q4_0. حقق نموذج الخبراء المختلطين (MoE) Qwen3.5-35B-A3B سرعة 317.45 رمزًا في الثانية، مستخدمًا فقط 41% من عرض النطاق الترددي للذاكرة، بينما حقق النموذج الكثيف Qwen3.5-9B سرعة 239.62 رمزًا في الثانية، مستخدمًا 72% من العرض الترددي. استبعد المؤلف تأثير الرسوم البيانية لـ CUDA، والتوجيه، وعدم استغلال وحدة معالجة الرسوميات بشكل كافٍ. بدلاً من ذلك، أظهر من خلال نواة ggml اصطناعية أن عرض النطاق الترددي للذاكرة يتدرج مع عدد البايتات المقروءة لكل نواة: القراءات الصغيرة (بضعة ميغابايت) تحقق فقط 20-50% من الذروة. نظرًا لأن نموذج الخبراء المختلطين (MoE) يحتوي على العديد من إسقاطات الخبراء، فإنه ينتج العديد من النوى الصغيرة (متوسط 4.6 ميغابايت لكل نواة)، وهو أقل من الحد الأدنى المطلوب لتحقيق العرض الترددي الكامل. بينما يقرأ النموذج الكثيف مصفوفات أكبر (22.2 ميغابايت لكل نواة)، محققًا 86% من الذروة. يتنبأ المؤلف بسرعة النموذج الكثيف ضمن 3.7% وتدرج عمق السياق ضمن 2.4%، مما يتحقق من صحة نموذجه. كما لاحظ قانونًا تقريبيًا للتوسع: الحد الأدنى لتحقيق 90% من العرض الترددي يتدرج مع عرض وحدة معالجة الرسوميات (8 أضعاف من RTX 4060 إلى 5090).
المصدر: Habr — хаб ИИ —
الأصلي
