DGX Spark पर DeepSeek 0731: 68 tok/s तक ओवरक्लॉकिंग और कार्ड लेखक को 57 क्यों मिला
DeepSeek
NVIDIA
vLLM
एक डेवलपर डुअल NVIDIA DGX Spark सेटअप पर DeepSeek-V4-Flash का बेंचमार्क करता है, शुरुआत में 42.5 tok/s मापता है जबकि मॉडल कार्ड पर 57 tok/s का दावा किया गया है। vLLM रनटाइम इमेज बदलने और B12X MoE बैकएंड को स्पष्ट रूप से सक्षम करने के बाद, उन्होंने कार्ड-जैसी प्रोफ़ाइल पर 67.6 tok/s हासिल किया, जिसका श्रेय विशिष्ट कॉन्फ़िगरेशन परिवर्तनों को दिया।
लेखक ने दो DGX Spark नोड्स पर DeepSeek-V4-Flash तैनात किया, जो QSFP 200G और RoCEv2 के माध्यम से जुड़े थे, और नोड्स के बीच टेंसर समानांतरता का उपयोग किया। प्रारंभिक मापन में 42.5 tok/s दिखा, जो मॉडल कार्ड पर दावा किए गए 57 tok/s से लगभग 25% कम है। कई परिकल्पनाओं (तापमान, प्रीफिल गणना, संदर्भ लंबाई) का परीक्षण करने के बाद, मुख्य अंतर रनटाइम छवि को जिम्मेदार ठहराया गया: vLLM 0.21.1-आधारित बिल्ड से vLLM 0.25.2 वाले बिल्ड पर स्विच करने से उसी चेकपॉइंट पर +22% मिला, जिससे सत्यापन चरण में आउटपुट टोकन प्रति चरण 3.27 से बढ़कर 4.80 हो गए। आगे के लाभ --moe-backend flashinfer_b12x को स्पष्ट रूप से सेट करने से मिले, क्योंकि कस्टम छवि में B12X को स्वचालित चयन से बाहर रखा गया है; इसने कार्ड-जैसे प्रोफ़ाइल पर औसतन +13.3% जोड़ा (59.7 से 67.6 tok/s)। लेखक ने एक नया चेकपॉइंट रिलीज़ (0731) भी नोट किया, जिसमें एजेंट बेंचमार्क में सुधार है, और tonyd2wild द्वारा समान अनुकूलन पर समानांतर कार्य को स्वीकार किया।
स्रोत: Habr — хаб ИИ —
मूल
