Start een vLLM-server op HF Jobs met één commando
Hugging Face
vLLM
Hugging Face heeft de mogelijkheid geïntroduceerd om met één commando een vLLM-server te starten op de HF Jobs-infrastructuur. Gebruikers kunnen hierdoor snel een model implementeren voor testen, evaluatie of batchverwerking, waarbij GPU-bronnen per minuut worden gefactureerd.
Hugging Face (HF) heeft een nieuwe functie gelanceerd: je kunt met één opdracht een vLLM-server implementeren op het HF Jobs-platform. Hiervoor heb je een betaalmethode nodig, de huggingface_hub-bibliotheek versie >=1.20.0 en lokale authenticatie. Het commando `hf jobs run` gebruikt de officiële afbeelding `vllm/vllm-openai`, specificeert de GPU via `--flavor` en stelt een poort bloot via `--expose`. Bijvoorbeeld: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. Na het starten wordt een URL verstrekt voor toegang tot de server via een OpenAI-compatibele API met autorisatie via een HF-token. Verzoeken kunnen worden verzonden met `curl` of de Python OpenAI-client. Toegang tot het eindpunt is beperkt - er is een token met leesrechten vereist. De server kan worden gestopt met het commando `hf jobs cancel <job_id>`. Voor grote modellen (bijv. Qwen3.5-122B-A10B op twee H200 GPU's) moet je een krachtigere flavor kiezen en `--tensor-parallel-size` specificeren, en indien nodig `--max-model-len` en `--max-num-seqs` verlagen. Extra opties zijn onder meer: starten met een Gradio-interface, SSH-toegang voor foutopsporing en gebruik als backend voor de coderingsagent Pi met tool calling ingeschakeld. HF Jobs is geschikt voor experimenten en eenmalige taken, terwijl Inference Endpoints worden aanbevolen voor productie.
Bron: Hugging Face blog —
origineel
