स्ट्रिक्स हेलो पर मिनी-पीसी का समानांतर लोड टेस्ट: 32 समवर्ती अनुरोधों पर 236 टोकन/सेकंड और तीन त्रुटियाँ

Google/DeepMindGoogle/DeepMind
Ryzen AI Max+ 395 वाले Beelink GTR9 Pro ने 32 समवर्ती अनुरोधों पर छोटे रन में 236 tok/s की कुल गति हासिल की, और 30 मिनट तक बिना थ्रॉटलिंग के औसत 226 tok/s बनाए रखा। लेखक ने सभी परीक्षित मॉडलों पर 8 से 10 समवर्ती क्लाइंट के बीच एक पुनरुत्पादनीय थ्रूपुट गिरावट पाई, और पाया कि स्पेक्युलेटिव डिकोडिंग (MTP) ने एकल-क्लाइंट प्रदर्शन को 42% तक बढ़ाया लेकिन समवर्तीता के तहत दंड बन गया।
Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 GB एकीकृत मेमोरी) का परीक्षण करते हुए, लेखक ने Vulkan/RADV के माध्यम से llama.cpp के साथ समानांतर अनुमान बेंचमार्क चलाए। Qwen 3.6 35B-A3B को Q4_K_M में चलाने पर थ्रूपुट में एक गड्ढा देखा गया: 8 क्लाइंट पर 149 tok/s से घटकर 10 क्लाइंट पर 99 tok/s हो गया, फिर 32 क्लाइंट पर 160 tok/s तक सुधार हुआ। यह गड्ढा सभी परीक्षण किए गए मॉडलों (तीन क्वांट में Qwen और QAT में Gemma 4 26B) में दोहराया गया और इसे एकल मॉडल या क्वांट के लिए जिम्मेदार नहीं ठहराया जा सका। सबसे अच्छा कुल थ्रूपुट 236 tok/s था, जो 32 क्लाइंट पर Gemma 4 के साथ प्राप्त हुआ (75-सेकंड के रनों का माध्य)। 30 मिनट के सहनशक्ति परीक्षण में औसत 226.4 tok/s रहा, जिसमें तापमान (78°C) और बिजली (113 W) स्थिर रही, तथा सर्वर टाइमिंग में कमी के कारण 1.4% त्रुटियाँ हुईं। स्पेक्युलेटिव डिकोडिंग (MTP) ने एकल-क्लाइंट गति को 42% (53.3→75.6 tok/s) बढ़ाया, लेकिन सहवर्तिता को नुकसान पहुँचाया: 4 क्लाइंट पर यह 31% घट गया, 32 क्लाइंट पर थ्रूपुट में 33% की गिरावट आई। लेखक ने नियंत्रण मापों द्वारा प्रकाशन से पहले पकड़ी गई तीन गलतियों का उल्लेख किया है।
स्रोत: Habr — хаб NLP — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार