vLLM के लिए हगिंग फेस ट्रांसफॉर्मर्स बैकएंड ने देशी प्रदर्शन हासिल किया
Hugging Face
vLLM में मॉडलिंग बैकएंड के रूप में हगिंग फेस ट्रांसफॉर्मर्स का एकीकरण अब विभिन्न Qwen3 मॉडलों में, जिसमें डेंस और मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर शामिल हैं, देशी vLLM थ्रूपुट से मेल खाता है या उससे आगे निकल जाता है, बिना कस्टम पोर्टिंग की आवश्यकता के। यह torch.fx और AST मैनिपुलेशन का उपयोग करके रनटाइम पर डायनामिक लेयर फ्यूजन के माध्यम से प्राप्त किया जाता है, जिससे किसी भी संगत मॉडल को एक ही फ़्लैग के साथ देशी गति पर चलाया जा सकता है।
हगिंग फेस ट्रांसफॉर्मर्स लाइब्रेरी, जो 450 से अधिक आर्किटेक्चर का समर्थन करती है, को पिछले वर्ष से vLLM में एक मॉडलिंग बैकएंड के रूप में एकीकृत किया गया है, जिससे मॉडल लेखक बिना पोर्टिंग के vLLM के अंदर ट्रांसफॉर्मर्स मॉडल चला सकते हैं। इस एकीकरण का नवीनतम संस्करण अब संगत मॉडलों के लिए मूल vLLM इनफरेंस गति प्राप्त करता है। तीन Qwen3 मॉडलों (4B डेंस, 32B डेंस, और 235B FP8 MoE) पर vLLM के मूल कार्यान्वयन के साथ ट्रांसफॉर्मर्स बैकएंड की सीधी तुलना करने वाले बेंचमार्क दिखाते हैं कि ट्रांसफॉर्मर्स बैकएंड सभी मामलों में मूल थ्रूपुट को पूरा या पार करता है। प्रदर्शन सुधार रनटाइम पर इनफरेंस-विशिष्ट लेयर फ्यूज़न को गतिशील रूप से लागू करने से आता है, जिसमें स्थैतिक विश्लेषण के लिए torch.fx और सोर्स कोड हेरफेर के लिए AST का उपयोग किया जाता है। इन फ्यूज़न में MoE मॉडलों में एक्सपर्ट समानांतरीकरण के लिए vLLM के अनुकूलित कर्नेल पर मैप किए गए ऑपरेशन, साथ ही टेंसर और पाइपलाइन समानांतरता के लिए समानांतर रैखिक लेयर शामिल हैं। हेरफेर किए गए मॉडल torch.compile और CUDA ग्राफ़ के साथ पूरी तरह से कंपाइल करने योग्य रहते हैं। किसी भी हगिंग फेस मॉडल को एकल फ्लैग --model-impl transformers के साथ चलाया जा सकता है, और यह मौजूदा समानांतरता विकल्पों के साथ संयोजित होता है। रैखिक अटेंशन वाले मॉडल अभी तक समर्थित नहीं हैं, और हब रिपॉजिटरी से कस्टम मॉडल के काम करने की संभावना नहीं है।
स्रोत: Hugging Face blog —
मूल
