محرك Hugging Face Transformers الخلفي لـ vLLM يحقق أداءً أصليًا

Hugging FaceHugging Face
دمج Hugging Face Transformers كمحرك خلفي للنمذجة في vLLM أصبح يطابق أو يتجاوز إنتاجية vLLM الأصلية عبر نماذج Qwen3 المختلفة، بما في ذلك البنى الكثيفة وخبراء المزج، دون الحاجة إلى نقل مخصص. يتم تحقيق ذلك من خلال الدمج الديناميكي للطبقات في وقت التشغيل باستخدام torch.fx ومعالجة شجرة النحو المجرد (AST)، مما يسمح لأي نموذج متوافق بالعمل بسرعة أصلية باستخدام علامة واحدة.
تم دمج مكتبة Hugging Face Transformers، التي تدعم أكثر من 450 بنية، كواجهة خلفية للنمذجة في vLLM منذ العام الماضي، مما يمكّن مؤلفي النماذج من تشغيل نماذج Transformers داخل vLLM دون الحاجة إلى نقلها. التكرار الأخير لهذا التكامل يحقق الآن سرعة استدلال أصلية لـ vLLM للنماذج المتوافقة. تُظهر المقاييس التي تقارن الواجهة الخلفية لـ Transformers وجهاً لوجه مع التطبيقات الأصلية لـ vLLM عبر ثلاثة نماذج من Qwen3 (4B كثيف، 32B كثيف، و235B FP8 MoE) أن الواجهة الخلفية لـ Transformers تفي أو تتجاوز الإنتاجية الأصلية في جميع الحالات. يأتي تحسين الأداء من التطبيق الديناميكي لدمج الطبقات الخاصة بالاستدلال في وقت التشغيل، باستخدام torch.fx للتحليل الثابت و AST (أشجار التركيب المجردة) للتلاعب بالشفرة المصدرية. تتضمن هذه الدمج عمليات تُسقط على نوى محسّنة لـ vLLM للتوزيع المتوازي للخبراء في نماذج MoE، بالإضافة إلى طبقات خطية متوازية لتوازي الموتر والتوزيع المتوازي عبر الأنابيب. تظل النماذج المعالجة قابلة للتجميع بالكامل مع torch.compile و CUDA Graphs. يمكن تشغيل أي نموذج من Hugging Face باستخدام العلامة الواحدة --model-impl transformers، ويتكامل مع خيارات التوازي الموجودة. النماذج ذات الانتباه الخطي غير مدعومة بعد، ومن غير المرجح أن تعمل النماذج المخصصة من مستودعات Hub.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة