Hardware e InferenciaCódigo Abierto 🇺🇸 27.07.2026 10:04

Inicia un servidor vLLM en trabajos de HF con un solo comando

Hugging FaceHugging Face vLLMvLLM
Hugging Face ha presentado la capacidad de iniciar un servidor vLLM en la infraestructura de trabajos de HF con un solo comando. Esto permite a los usuarios implementar rápidamente un modelo para pruebas, evaluación o generación por lotes, utilizando recursos de GPU facturados por minuto.
Hugging Face (HF) ha lanzado una nueva funcionalidad: puedes desplegar un servidor vLLM en la plataforma HF Jobs con un solo comando. Para ello, necesitas un método de pago, la biblioteca huggingface_hub versión >=1.20.0 y autenticación local. El comando `hf jobs run` utiliza la imagen oficial `vllm/vllm-openai`, especifica la GPU mediante `--flavor` y expone un puerto con `--expose`. Por ejemplo: `hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. Tras el lanzamiento, se proporciona una URL para acceder al servidor a través de una API compatible con OpenAI, con autorización mediante un token de HF. Las solicitudes se pueden enviar con `curl` o con el cliente Python de OpenAI. El acceso al endpoint está restringido: se requiere un token con permisos de lectura. El servidor se puede detener con el comando `hf jobs cancel <job_id>`. Para modelos grandes (por ejemplo, Qwen3.5-122B-A10B en dos GPUs H200), debes elegir un flavor más potente y especificar `--tensor-parallel-size`, y si es necesario, reducir `--max-model-len` y `--max-num-seqs`. Opciones adicionales incluyen: lanzar con una interfaz Gradio, acceso SSH para depuración y usarlo como backend para el agente de codificación Pi con llamada de herramientas habilitada. HF Jobs es adecuado para experimentos y tareas puntuales, mientras que se recomiendan los Inference Endpoints para producción.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas