Khởi chạy máy chủ vLLM trên HF Jobs chỉ với một lệnh duy nhất
Hugging Face
vLLM
Hugging Face đã giới thiệu khả năng khởi chạy máy chủ vLLM trên hạ tầng HF Jobs chỉ với một lệnh duy nhất. Điều này cho phép người dùng triển khai nhanh chóng một mô hình để thử nghiệm, đánh giá hoặc sinh dữ liệu hàng loạt, sử dụng tài nguyên GPU được tính phí theo phút.
Hugging Face (HF) đã ra mắt tính năng mới: bạn có thể triển khai một máy chủ vLLM trên nền tảng HF Jobs chỉ với một lệnh duy nhất. Để làm được điều này, bạn cần có phương thức thanh toán, thư viện huggingface_hub phiên bản >=1.20.0 và xác thực cục bộ. Lệnh `hf jobs run` sử dụng hình ảnh chính thức `vllm/vllm-openai`, chỉ định GPU qua `--flavor` và mở một cổng qua `--expose`. Ví dụ: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. Sau khi khởi chạy, bạn sẽ nhận được một URL để truy cập máy chủ thông qua API tương thích với OpenAI, với xác thực bằng mã thông báo HF. Bạn có thể gửi yêu cầu bằng `curl` hoặc trình khách (client) Python của OpenAI. Truy cập vào điểm cuối bị hạn chế - cần có mã thông báo có quyền đọc. Bạn có thể dừng máy chủ bằng lệnh `hf jobs cancel <job_id>`. Đối với các mô hình lớn (ví dụ: Qwen3.5-122B-A10B trên hai GPU H200), bạn cần chọn một flavor mạnh hơn và chỉ định `--tensor-parallel-size`, đồng thời nếu cần, giảm `--max-model-len` và `--max-num-seqs`. Các tùy chọn bổ sung bao gồm: khởi chạy với giao diện Gradio, truy cập SSH để gỡ lỗi và sử dụng nó làm phần phụ trợ cho tác nhân lập trình Pi với gọi công cụ được bật. HF Jobs phù hợp cho các thử nghiệm và các tác vụ một lần, trong khi Inference Endpoints được khuyến nghị cho môi trường sản xuất.
Nguồn: Hugging Face blog —
bản gốc
