Käynnistä vLLM-palvelin HF-töissä yhdellä komennolla
Hugging Face
vLLM
Hugging Face on ottanut käyttöön mahdollisuuden käynnistää vLLM-palvelin HF-töiden infrastruktuurissa yhdellä komennolla. Tämä mahdollistaa mallin nopean käyttöönoton testausta, arviointia tai eräajoa varten, jolloin GPU-resursseja laskutetaan minuutin tarkkuudella.
Hugging Face (HF) on julkaissut uuden ominaisuuden: voit ottaa vLLM-palvelimen käyttöön HF Jobs -alustalla yhdellä komennolla. Tätä varten tarvitset maksutavan, huggingface_hub-kirjaston version vähintään 1.20.0 sekä paikallisen todennuksen. Komento `hf jobs run` käyttää virallista `vllm/vllm-openai`-kuvaa, määrittää GPU:n `--flavor`-lipulla ja avaa portin `--expose`-lipulla. Esimerkiksi: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. Käynnistyksen jälkeen saat URL-osoitteen, jonka kautta voit käyttää palvelinta OpenAI-yhteensopivan API:n kautta ja todennus tapahtuu HF-tokenilla. Pyynnöt voit lähettää joko `curl`-komennolla tai Pythonin OpenAI-asiakaskirjastolla. Pääsy päätepisteeseen on rajattu – vaaditaan token, jolla on lukuoikeudet. Palvelimen voit pysäyttää komennolla `hf jobs cancel <job_id>`. Suurille malleille (esimerkiksi Qwen3.5-122B-A10B kahdella H200-GPU:lla) sinun on valittava tehokkaampi flavor ja määritettävä `--tensor-parallel-size`, ja tarvittaessa pienennettävä `--max-model-len`- ja `--max-num-seqs`-arvoja. Muita vaihtoehtoja ovat: käynnistäminen Gradio-käyttöliittymällä, SSH-yhteys vianetsintää varten sekä käyttö koodausagentti Pi:n taustajärjestelmänä työkalukutsut käytössä. HF Jobs sopii kokeiluihin ja kertaluonteisiin tehtäviin, kun taas Inference Endpoints -palvelua suositellaan tuotantokäyttöön.
Lähde: Hugging Face blog —
Alkuperäinen
