単一コマンドでvLLMサーバーをHF Jobs上で起動

Hugging FaceHugging Face vLLMvLLM
Hugging Faceは、単一コマンドでvLLMサーバーをHF Jobsインフラ上で起動できる機能を導入しました。これにより、ユーザーはGPUリソースを分単位で課金しながら、テスト、評価、またはバッチ生成のためにモデルを迅速にデプロイできます。
Hugging Face(HF)は新しい機能を発表しました。HF Jobsプラットフォーム上で、単一のコマンドでvLLMサーバーをデプロイできるようになりました。これには、支払い方法、huggingface_hubライブラリのバージョン1.20.0以上、およびローカルでの認証が必要です。`hf jobs run`コマンドは、公式イメージ`vllm/vllm-openai`を使用し、`--flavor`でGPUを指定し、`--expose`でポートを公開します。例えば、`hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`のように実行します。起動後、OpenAI互換APIを介してサーバーにアクセスするためのURLが提供され、認証はHFトークンを使用します。リクエストは`curl`またはPythonのOpenAIクライアントを使用して送信できます。エンドポイントへのアクセスは制限されており、読み取り権限を持つトークンが必要です。サーバーは`hf jobs cancel <job_id>`コマンドで停止できます。大規模モデル(例:2つのH200 GPUでのQwen3.5-122B-A10B)の場合は、より強力なフレーバーを選択し、`--tensor-parallel-size`を指定し、必要に応じて`--max-model-len`と`--max-num-seqs`を減らす必要があります。追加オプションには、Gradio UIでの起動、デバッグ用のSSHアクセス、ツール呼び出しを有効にしたコーディングエージェントPiのバックエンドとしての使用が含まれます。HF Jobsは実験や単発のタスクに適しており、本番環境にはInference Endpointsが推奨されます。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース