RTX 5090 पर MoE 1.5x से कम प्रदर्शन करता है, और यह रूटिंग के बारे में नहीं है
RTX 5090 पर एक विस्तृत बेंचमार्क से पता चलता है कि एक मिश्रित-विशेषज्ञ मॉडल (Qwen3.5-35B-A3B) GPU की मेमोरी बैंडविड्थ का केवल 41% उपयोग करता है, जबकि एक घना मॉडल (Qwen3.5-9B) 72% प्राप्त करता है। मूल कारण प्रति कर्नेल लॉन्च में पढ़े गए अपर्याप्त बाइट्स हैं, न कि विशेषज्ञ रूटिंग। लेखक उच्च सटीकता के साथ एक अन्य मॉडल और विभिन्न संदर्भ गहराई के लिए प्रदर्शन की भविष्यवाणी करता है।
लेखक llama.cpp b10326 के साथ Q4_0 परिमाणीकरण का उपयोग करके RTX 5090 का बेंचमार्क करता है। MoE मॉडल Qwen3.5-35B-A3B 317.45 टोकन/सेकंड प्राप्त करता है, केवल 41% मेमोरी बैंडविड्थ का उपयोग करता है, जबकि घना Qwen3.5-9B 239.62 टोकन/सेकंड प्राप्त करता है, 72% का उपयोग करता है। वे CUDA ग्राफ़, रूटिंग और GPU के कम उपयोग को खारिज करते हैं। इसके बजाय, वे एक सिंथेटिक ggml कर्नेल के माध्यम से प्रदर्शित करते हैं कि मेमोरी बैंडविड्थ प्रति कर्नेल पढ़े गए बाइट्स के साथ स्केल करती है: छोटे रीड (कुछ MB) केवल 20-50% पीक बैंडविड्थ प्राप्त करते हैं। MoE मॉडल के कई विशेषज्ञ प्रोजेक्शन के परिणामस्वरूप कई छोटे कर्नेल (औसत 4.6 MB प्रति कर्नेल) होते हैं, जो पूर्ण बैंडविड्थ के लिए सीमा से नीचे आते हैं। घने मॉडल बड़े मैट्रिक्स (22.2 MB प्रति कर्नेल) पढ़ता है, जो 86% पीक प्राप्त करता है। लेखक 3.7% के भीतर घने मॉडल की गति और 2.4% के भीतर संदर्भ गहराई स्केलिंग की भविष्यवाणी करता है, अपने मॉडल को मान्य करता है। वे एक अस्थायी स्केलिंग कानून भी नोट करते हैं: 90% बैंडविड्थ के लिए सीमा GPU चौड़ाई के साथ स्केल करती है (RTX 4060 से 5090 तक 8x)।
स्रोत: Habr — хаб ИИ —
मूल
