--flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000`. После запуска предоставляется URL-адрес для доступа к серверу через API, совместимый с OpenAI, с авторизацией через HF-токен. Запросы можно отправлять с помощью `curl` или Python-клиента OpenAI. Доступ к конечной точке ограничен — требуется токен с правами на чтение. Остановить сервер можно командой `hf jobs cancel <job_id>`. Для больших моделей (например, Qwen3.5-122B-A10B на двух графических процессорах H200) нужно выбрать более мощный flavor и указать `--tensor-parallel-size`, а при необходимости уменьшить `--max-model-len` и `--max-num-seqs`. Дополнительные опции включают: запуск с Gradio UI, SSH-доступ для отладки и использование в качестве бэкенда для агента-программиста Pi с включенным вызовом инструментов. HF Jobs подходит для экспериментов и разовых задач, в то время как для продакшена рекомендуются Inference Endpoints.