Hardware e Inferencia RSS

Código Abierto 🇺🇸

El backend de Hugging Face Transformers para vLLM alcanza rendimiento nativo

La integración de Hugging Face Transformers como backend de modelado en vLLM ahora iguala o supera el rendimiento nativo de vLLM en varios modelos Qwen3, incluyendo arquitecturas densas y de mezcla de expertos, sin necesidad de portabilidad personalizada. Esto se logra mediante fusiones dinámicas de capas en tiempo de ejecución usando torch.fx y manipulación del AST, permitiendo que cualquier modelo compatible funcione a velocidad nativa con una sola bandera.

Hugging FaceHugging Face
Hugging Face blog27.07 · 04:05
Noticias frescas