Código AbiertoHardware e Inferencia 🇺🇸 27.07.2026 04:05

El backend de Hugging Face Transformers para vLLM alcanza rendimiento nativo

Hugging FaceHugging Face
La integración de Hugging Face Transformers como backend de modelado en vLLM ahora iguala o supera el rendimiento nativo de vLLM en varios modelos Qwen3, incluyendo arquitecturas densas y de mezcla de expertos, sin necesidad de portabilidad personalizada. Esto se logra mediante fusiones dinámicas de capas en tiempo de ejecución usando torch.fx y manipulación del AST, permitiendo que cualquier modelo compatible funcione a velocidad nativa con una sola bandera.
La biblioteca Transformers de Hugging Face, que admite más de 450 arquitecturas, se ha integrado como un backend de modelado en vLLM desde el año pasado, lo que permite a los autores de modelos ejecutar modelos de Transformers dentro de vLLM sin necesidad de portarlos. La última iteración de esta integración alcanza ahora la velocidad de inferencia nativa de vLLM para modelos compatibles. Las evaluaciones comparativas que enfrentan al backend de Transformers directamente con las implementaciones nativas de vLLM en tres modelos Qwen3 (4B denso, 32B denso y 235B FP8 MoE) muestran que el backend de Transformers iguala o supera el rendimiento nativo en todos los casos. La mejora del rendimiento proviene de aplicar dinámicamente fusiones de capas específicas para inferencia en tiempo de ejecución, utilizando torch.fx para el análisis estático y AST para la manipulación del código fuente. Estas fusiones incluyen operaciones asignadas a los kernels optimizados de vLLM para la paralelización de expertos en modelos MoE, así como capas lineales paralelas para paralelismo de tensores y de tuberías. Los modelos manipulados siguen siendo completamente compilables con torch.compile y CUDA Graphs. Cualquier modelo de Hugging Face se puede ejecutar con la única bandera --model-impl transformers, y se combina con las opciones de paralelismo existentes. Los modelos con atención lineal aún no son compatibles, y es poco probable que funcionen modelos personalizados de repositorios de Hub.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas