一键启动 HF Jobs 上的 vLLM 服务器
Hugging Face
vLLM
Hugging Face 推出了通过单条命令在 HF Jobs 基础设施上启动 vLLM 服务器的功能。用户可以快速部署模型用于测试、评估或批量生成,GPU 资源按分钟计费。
Hugging Face(HF)推出了一项新功能:只需一条命令,即可在 HF Jobs 平台上部署 vLLM 服务器。为此,您需要一种支付方式、huggingface_hub 库版本不低于 1.20.0,并且要在本地进行身份验证。命令 `hf jobs run` 使用官方镜像 `vllm/vllm-openai`,通过 `--flavor` 指定 GPU,并通过 `--expose` 暴露端口。例如:`hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`。启动后,会提供一个 URL,用于通过兼容 OpenAI 的 API 访问服务器,并使用 HF 令牌进行授权。可以使用 `curl` 或 Python OpenAI 客户端发送请求。端点的访问受到限制——需要具有读取权限的令牌。可以使用命令 `hf jobs cancel <job_id>` 停止服务器。对于大型模型(例如,在两个 H200 GPU 上的 Qwen3.5-122B-A10B),您需要选择更强大的 flavor,并指定 `--tensor-parallel-size`,如有必要,还需减小 `--max-model-len` 和 `--max-num-seqs`。其他选项包括:使用 Gradio UI 启动、启用 SSH 访问以进行调试,以及将其用作启用工具调用的编码代理 Pi 的后端。HF Jobs 适用于实验和一次性任务,而 Inference Endpoints 则推荐用于生产环境。
来源: Hugging Face blog —
原文
