하드웨어 및 추론오픈 소스 🇺🇸 27.07.2026 10:04

단일 명령어로 HF Jobs에서 vLLM 서버 실행

Hugging FaceHugging Face vLLMvLLM
Hugging Face는 단일 명령어로 HF Jobs 인프라에서 vLLM 서버를 실행할 수 있는 기능을 도입했습니다. 이를 통해 사용자는 GPU 리소스를 분 단위로 과금하며 테스트, 평가 또는 배치 생성을 위해 모델을 빠르게 배포할 수 있습니다.
Hugging Face(HF)가 새로운 기능을 출시했습니다. 이제 명령어 하나로 HF Jobs 플랫폼에 vLLM 서버를 배포할 수 있습니다. 이를 위해서는 결제 수단, huggingface_hub 라이브러리 1.20.0 이상 버전, 그리고 로컬 인증이 필요합니다. `hf jobs run` 명령어는 공식 이미지인 `vllm/vllm-openai`를 사용하며, `--flavor`로 GPU를 지정하고 `--expose`로 포트를 노출합니다. 예를 들면 다음과 같습니다: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. 실행 후에는 OpenAI 호환 API를 통해 서버에 접근할 수 있는 URL이 제공되며, 인증은 HF 토큰을 통해 이루어집니다. 요청은 `curl`이나 Python OpenAI 클라이언트를 사용해 보낼 수 있습니다. 엔드포인트 접근은 제한되어 있어 읽기 권한이 있는 토큰이 필요합니다. 서버는 `hf jobs cancel <job_id>` 명령어로 중지할 수 있습니다. 대형 모델(예: H200 GPU 두 개를 사용하는 Qwen3.5-122B-A10B)의 경우, 더 강력한 flavor를 선택하고 `--tensor-parallel-size`를 지정해야 하며, 필요하다면 `--max-model-len`과 `--max-num-seqs` 값을 줄여야 합니다. 추가 옵션으로는 Gradio UI와 함께 실행하기, 디버깅을 위한 SSH 접근, 그리고 툴 호출(tool calling) 기능을 활성화한 코딩 에이전트 Pi의 백엔드로 사용하는 것 등이 있습니다. HF Jobs는 실험이나 일회성 작업에 적합하며, 프로덕션 환경에서는 Inference Endpoints 사용이 권장됩니다.
출처: Hugging Face blog — 원문
관련 게시물 ↓
새로운 뉴스