Hugging Face पर एक ही कमांड से vLLM सर्वर लॉन्च करें
Hugging Face
vLLM
Hugging Face ने HF Jobs इंफ्रास्ट्रक्चर पर एक ही कमांड से vLLM सर्वर लॉन्च करने की सुविधा शुरू की है। इससे उपयोगकर्ता परीक्षण, मूल्यांकन या बैच जनरेशन के लिए मॉडल को जल्दी से तैनात कर सकते हैं, जिसमें GPU संसाधनों का उपयोग प्रति मिनट बिल किया जाता है।
हगिंग फेस (HF) ने एक नई सुविधा शुरू की है: आप HF Jobs प्लेटफ़ॉर्म पर एक ही कमांड से vLLM सर्वर तैनात कर सकते हैं। इसके लिए आपको एक भुगतान विधि, huggingface_hub लाइब्रेरी का संस्करण >=1.20.0, और स्थानीय प्रमाणीकरण की आवश्यकता है। कमांड `hf jobs run` आधिकारिक छवि `vllm/vllm-openai` का उपयोग करता है, GPU को `--flavor` के माध्यम से निर्दिष्ट करता है, और `--expose` के माध्यम से एक पोर्ट उजागर करता है। उदाहरण के लिए: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`। लॉन्च करने के बाद, OpenAI-संगत API के माध्यम से सर्वर तक पहुंचने के लिए एक URL प्रदान किया जाता है, जिसमें HF टोकन के साथ प्राधिकरण होता है। अनुरोध `curl` या Python OpenAI क्लाइंट का उपयोग करके भेजे जा सकते हैं। एंडपॉइंट तक पहुंच प्रतिबंधित है — पढ़ने की अनुमति वाले टोकन की आवश्यकता होती है। सर्वर को `hf jobs cancel <job_id>` कमांड से रोका जा सकता है। बड़े मॉडलों के लिए (जैसे, दो H200 GPU पर Qwen3.5-122B-A10B), आपको एक अधिक शक्तिशाली flavor चुनने और `--tensor-parallel-size` निर्दिष्ट करने की आवश्यकता होती है, और यदि आवश्यक हो, तो `--max-model-len` और `--max-num-seqs` को कम करें। अतिरिक्त विकल्पों में शामिल हैं: Gradio UI के साथ लॉन्च करना, डिबगिंग के लिए SSH पहुंच, और टूल कॉलिंग सक्षम के साथ कोडिंग एजेंट Pi के लिए बैकएंड के रूप में उपयोग करना। HF Jobs प्रयोगों और एक बार के कार्यों के लिए उपयुक्त है, जबकि उत्पादन के लिए Inference Endpoints की सिफारिश की जाती है।
स्रोत: Hugging Face blog —
मूल
