كمبيوتر مصغر Strix Halo تحت الحمل المتوازي: 236 رمزًا/ثانية في 32 طلبًا متزامنًا وثلاثة أخطاء

Google/DeepMindGoogle/DeepMind
حقق جهاز Beelink GTR9 Pro المزود بمعالج Ryzen AI Max+ 395 إجمالي 236 رمزًا/ثانية في 32 طلبًا متزامنًا في جولات قصيرة، مع الحفاظ على متوسط 226 رمزًا/ثانية لمدة 30 دقيقة دون اختناق. اكتشف المؤلف انخفاضًا قابلًا للتكرار في الإنتاجية بين 8 و10 عملاء متزامنين عبر جميع النماذج المختبرة، ووجد أن فك الترميز التخميني (MTP) سرّع أداء العميل الفردي بنسبة 42% لكنه أصبح عقوبة تحت التزامن.
عند اختبار Beelink GTR9 Pro (بمعالج Ryzen AI Max+ 395، وراسم Radeon 8060S، وذاكرة موحدة 128 جيجابايت) باستخدام llama.cpp عبر Vulkan/RADV، أجرى المؤلف معايير استدلال متوازٍ. أظهر نموذج Qwen 3.6 35B-A3B بدقة Q4_K_M وادي إنتاجية من 149 رمز/ثانية عند 8 عملاء إلى 99 عند 10 عملاء، ثم ارتفع إلى 160 عند 32 عميلاً. تكرر هذا الوادي عبر جميع النماذج المختبرة (Qwen بثلاثة مستويات دقة، وGemma 4 26B بدقة QAT) ولم يُعزَ إلى نموذج أو دقة واحدة. بلغ أفضل إجمالي 236 رمز/ثانية باستخدام Gemma 4 عند 32 عميلاً (وسيط لجلسات استمرت 75 ثانية). سجّل اختبار تحمّل استمر 30 دقيقة متوسط 226.4 رمز/ثانية مع درجات حرارة مستقرة (78 درجة مئوية) واستهلاك طاقة 113 واط، مع نسبة خطأ 1.4% ناتجة عن توقيت خادم مفقود. أدى فك الترميز التخميني إلى زيادة سرعة العميل الواحد بنسبة 42% (من 53.3 إلى 75.6 رمز/ثانية) لكنه أضر بالتزامن: عند 4 عملاء تراجع بنسبة 31%، وعند 32 عميلاً خسر 33% من الإنتاجية. يشير المؤلف إلى ثلاثة أخطاء تم اكتشافها قبل النشر من خلال قياسات مراقبة.
المصدر: Habr — хаб NLP — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة