معمارية PDD تكسر حاجز الاستدلال غير المتجانس عبر المجموعات: تقليل زمن الاستجابة للرمز الأول بنسبة 51.5% وخفض التكلفة بنسبة 37.5%
Infinigence
كشفت InfiniteG (Infinigence) عن معمارية PDD، وهي معمارية استدلال غير متجانسة عبر المجموعات من ثلاث طبقات تقلل زمن الاستجابة للرمز الأول بنسبة 51.5% وتكلفة الرمز الواحد بنسبة 37.5%. من خلال إدراج مثيل محلي لـ RelayDecode (RLD) لإخفاء تأخيرات نقل ذاكرة التخزين المؤقت لـ KV عبر شبكة WAN، تتيح PDD الاستخدام الفعال للمجموعات المتجانسة الموزعة لاستدلال نماذج اللغة الكبيرة.
في مؤتمر WAIC 2026، قدمت InfiniteG بنية استدلال جديدة تُدعى PDD (Prefill-RelayDecode-MainDecode)، والتي تتحلل فيها عملية الفصل التقليدية بين مراحل PD إلى ثلاث مراحل. الفكرة الأساسية هي أن أعباء عمل الوكلاء تتميز بمعدلات مرتفعة وغير متجانسة في سرعة التخزين المؤقت (أكثر من 70-80% من الطلبات تحقق أكثر من 95% سرعة تخزين مؤقت)، مما يؤدي إلى معاناة عدد قليل فقط من الطلبات ذات السرعة المنخفضة من تأخيرات طويلة في نقل ذاكرة التخزين المؤقت KV عبر شبكة WAN (الشبكة الواسعة). تقوم PDD بإدراج مثيل RelayDecode (RLD) في نفس مجموعة Prefill، والذي يستلم ذاكرة KV عبر RDMA سريع ويبدأ التنبؤ فورًا، مما يُخفي التأخير البطيء في الإيثرنت إلى مثيل MainDecode (MD) البعيد. بمجرد أن يستلم MD ذاكرة KV الكاملة، فإن آلية تسليم تنقل فقط معرفات صغيرة للرموز (بحجم كيلوبايتات قليلة) إلى MD لإعادة الحساب محليًا، متجنبة نقل كميات كبيرة من KV. في الاختبارات على DeepSeek-V4-pro باستخدام سجلات وكلاء حقيقية، حققت PDD خفضًا في زمن استجابة أول رمز (TTFT) عند المئين 90 من 18.3 ثانية إلى 9.8 ثانية (بنسبة 46٪)، وعند المئين 99 من 29.7 ثانية إلى 14.4 ثانية، بينما تعامل RLD مع 6.2٪ فقط من توليد الرموز. انخفضت التكلفة الإجمالية للبنية التحتية بنسبة 3.5-7.1٪ بينما ارتفعت الإنتاجية الفعالة (عدد الطلبات المفيدة في الثانية) بنسبة 27.8٪، مما أدى إلى تحسن بنسبة 37.5٪ في نسبة الفائدة إلى التكلفة. يتيح هذا العمل إجراء استدلال غير متجانس عبر مجموعات متجانسة متصلة عبر شبكات WAN منخفضة التكلفة، مما يعظم استخدام الموارد الحاسوبية الموزعة.
المصدر: QbitAI 量子位 —
الأصلي
