El backend de Transformers para vLLM logra rendimiento nativo
Hugging Face
La biblioteca transformers se ha integrado en vLLM como backend de modelos, permitiendo que los modelos de Hugging Face se ejecuten sin necesidad de migración. La nueva versión optimiza dinámicamente el grafo del modelo mediante torch.fx y ast, ofreciendo una velocidad comparable a las implementaciones nativas de vLLM para arquitecturas compatibles.
La biblioteca transformers, que soporta más de 450 arquitecturas, ahora está completamente integrada en vLLM como backend de modelos. Gracias a esto, los modelos de Hugging Face pueden ejecutarse en vLLM sin necesidad de portarlos: transformers proporciona el código del modelo y vLLM, técnicas de inferencia optimizadas como procesamiento por lotes continuo y kernels de atención personalizados. La última versión del backend utiliza torch.fx para el análisis estático del grafo del modelo y ast para manipular el código fuente, aplicando fusiones de capas específicas para inferencia en tiempo de ejecución. Esto permite alcanzar o superar el rendimiento de las implementaciones nativas de vLLM, como se muestra en pruebas con tres modelos Qwen3: 4B, 32B y 235B (FP8 MoE). Para ejecutar cualquier modelo compatible, basta con la bandera --model-impl transformers, que se combina con las opciones estándar de paralelismo. Actualmente, no se admiten modelos con atención lineal ni modelos personalizados de Hub que no estén escritos de manera compatible. Los modelos optimizados siguen siendo completamente compilables mediante torch.compile y CUDA Graphs, y también pueden utilizarse para entrenamiento.
Fuente: Hugging Face blog —
original
