Hardware e InferênciaCódigo Aberto 🇺🇸 27.07.2026 10:04

Inicie o Servidor vLLM em Jobs do HF com Um Único Comando

Hugging FaceHugging Face vLLMvLLM
A Hugging Face introduziu a capacidade de iniciar um servidor vLLM na infraestrutura de Jobs do HF com um único comando. Isso permite que os usuários implantem rapidamente um modelo para teste, avaliação ou geração em lote, usando recursos de GPU cobrados por minuto.
A Hugging Face (HF) lançou um novo recurso: você pode implantar um servidor vLLM na plataforma HF Jobs com um único comando. Para isso, você precisa de um método de pagamento, da biblioteca huggingface_hub versão >=1.20.0 e autenticação local. O comando `hf jobs run` usa a imagem oficial `vllm/vllm-openai`, especifica a GPU via `--flavor` e expõe uma porta via `--expose`. Por exemplo: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. Após o lançamento, uma URL é fornecida para acessar o servidor por meio de uma API compatível com OpenAI, com autorização via token HF. As solicitações podem ser enviadas usando `curl` ou o cliente Python OpenAI. O acesso ao endpoint é restrito — é necessário um token com permissões de leitura. O servidor pode ser interrompido com o comando `hf jobs cancel <job_id>`. Para modelos grandes (por exemplo, Qwen3.5-122B-A10B em duas GPUs H200), você precisa escolher um flavor mais potente e especificar `--tensor-parallel-size` e, se necessário, reduzir `--max-model-len` e `--max-num-seqs`. Opções adicionais incluem: iniciar com uma interface Gradio, acesso SSH para depuração e uso como backend para o agente de codificação Pi com chamada de ferramentas habilitada. HF Jobs é adequado para experimentos e tarefas pontuais, enquanto Inference Endpoints são recomendados para produção.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas