HF Jobs Üzerinde Tek Komutla vLLM Sunucusu Başlatma
Hugging Face
vLLM
Hugging Face, kullanıcıların HF Jobs altyapısında tek bir komutla vLLM sunucusu başlatmasını sağlayan bir özellik duyurdu. Bu sayede kullanıcılar, dakika başına faturalandırılan GPU kaynaklarını kullanarak test, değerlendirme veya toplu üretim için bir modeli hızlıca dağıtabilecek.
Hugging Face (HF), yeni bir özellik başlattı: HF Jobs platformunda tek bir komutla bir vLLM sunucusu dağıtabilirsiniz. Bunun için bir ödeme yöntemi, huggingface_hub kütüphanesinin 1.20.0 veya daha yeni bir sürümü ve yerel kimlik doğrulama gerekir. `hf jobs run` komutu, resmi `vllm/vllm-openai` görüntüsünü kullanır, `--flavor` ile GPU'yu belirtir ve `--expose` ile bir bağlantı noktası (port) açar. Örneğin: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. Başlatmanın ardından, OpenAI uyumlu bir API üzerinden sunucuya erişim sağlayan bir URL verilir; bu erişim, HF jetonu (token) ile yetkilendirilir. İstekler `curl` veya Python OpenAI istemcisi kullanılarak gönderilebilir. Uç noktaya erişim kısıtlıdır; okuma iznine sahip bir jeton gereklidir. Sunucu, `hf jobs cancel <job_id>` komutuyla durdurulabilir. Büyük modeller için (örneğin, iki H200 GPU üzerinde Qwen3.5-122B-A10B) daha güçlü bir flavor seçmeniz ve `--tensor-parallel-size` belirtmeniz gerekir; ayrıca gerekirse `--max-model-len` ve `--max-num-seqs` değerlerini azaltın. Ek seçenekler şunlardır: Gradio arayüzüyle başlatma, hata ayıklama için SSH erişimi ve araç çağırma özelliği etkinleştirilmiş kodlama aracısı Pi için arka uç olarak kullanma. HF Jobs, denemeler ve tek seferlik görevler için uygundur; üretim için ise Inference Endpoints önerilir.
Kaynak: Hugging Face blog —
orijinal
