Inicia un servidor vLLM en trabajos de HF con un solo comando
Hugging Face ha presentado la capacidad de iniciar un servidor vLLM en la infraestructura de trabajos de HF con un solo comando. Esto permite a los usuarios implementar rápidamente un modelo para pruebas, evaluación o generación por lotes, utilizando recursos de GPU facturados por minuto.
Hugging Face
vLLM
Hugging Face blog27.07 · 10:04
