Luncurkan Server vLLM pada HF Jobs dengan Satu Perintah
Hugging Face
vLLM
Hugging Face telah memperkenalkan kemampuan untuk meluncurkan server vLLM pada infrastruktur HF Jobs dengan satu perintah. Ini memungkinkan pengguna untuk dengan cepat menyebarkan model untuk pengujian, evaluasi, atau pembuatan batch, menggunakan sumber daya GPU yang ditagih per menit.
Hugging Face (HF) telah meluncurkan fitur baru: Anda dapat menyebarkan server vLLM di platform HF Jobs dengan satu perintah. Untuk ini, Anda memerlukan metode pembayaran, pustaka huggingface_hub versi >=1.20.0, dan autentikasi lokal. Perintah `hf jobs run` menggunakan citra resmi `vllm/vllm-openai`, menentukan GPU melalui `--flavor`, dan mengekspos port melalui `--expose`. Contohnya: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. Setelah diluncurkan, URL disediakan untuk mengakses server melalui API yang kompatibel dengan OpenAI dengan otorisasi melalui token HF. Permintaan dapat dikirim menggunakan `curl` atau klien Python OpenAI. Akses ke endpoint dibatasi — token dengan izin baca diperlukan. Server dapat dihentikan dengan perintah `hf jobs cancel <job_id>`. Untuk model besar (misalnya, Qwen3.5-122B-A10B pada dua GPU H200), Anda perlu memilih flavor yang lebih kuat dan menentukan `--tensor-parallel-size`, serta jika perlu, kurangi `--max-model-len` dan `--max-num-seqs`. Opsi tambahan meliputi: meluncurkan dengan UI Gradio, akses SSH untuk debugging, dan menggunakannya sebagai backend untuk agen pengkodean Pi dengan alat yang diaktifkan. HF Jobs cocok untuk eksperimen dan tugas satu kali, sementara Inference Endpoints direkomendasikan untuk produksi.
Sumber: Hugging Face blog —
asli
