تشغيل خادم vLLM على وظائف HF بأمر واحد
Hugging Face
vLLM
قدمت Hugging Face القدرة على تشغيل خادم vLLM على بنية وظائف HF بأمر واحد. يتيح ذلك للمستخدمين نشر نموذج بسرعة للاختبار أو التقييم أو التوليد الدفعي، باستخدام موارد وحدة معالجة الرسوم (GPU) التي تُفوتر بالدقيقة.
أطلقت منصة Hugging Face (HF) ميزة جديدة: يمكنك نشر خادم vLLM على منصة HF Jobs بأمر واحد. لإجراء ذلك، تحتاج إلى طريقة دفع، وإصدار مكتبة huggingface_hub >= 1.20.0، ومصادقة محلية. يستخدم الأمر `hf jobs run` الصورة الرسمية `vllm/vllm-openai`، ويحدد وحدة معالجة الرسوميات (GPU) عبر `--flavor`، ويكشف عن منفذ عبر `--expose`. على سبيل المثال: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. بعد التشغيل، يتم توفير رابط للوصول إلى الخادم عبر واجهة برمجة تطبيقات متوافقة مع OpenAI مع تفويض عبر رمز HF. يمكن إرسال الطلبات باستخدام `curl` أو عميل OpenAI في بايثون. الوصول إلى نقطة النهاية مقيد - يلزم رمز بصلاحيات قراءة. يمكن إيقاف الخادم بالأمر `hf jobs cancel <job_id>`. بالنسبة للنماذج الكبيرة (مثل Qwen3.5-122B-A10B على وحدتي H200 GPU)، تحتاج إلى اختيار نوع أقوى وتحديد `--tensor-parallel-size`، وإذا لزم الأمر، تقليل `--max-model-len` و`--max-num-seqs`. تشمل الخيارات الإضافية: التشغيل مع واجهة Gradio، والوصول عبر SSH للتصحيح، واستخدامها كواجهة خلفية للوكيل البرمجي Pi مع تفعيل استدعاء الأدوات. تعد HF Jobs مناسبة للتجارب والمهام لمرة واحدة، بينما يُنصح باستخدام نقاط نهاية الاستدلال للإنتاج.
المصدر: Hugging Face blog —
الأصلي
