Backend Hugging Face Transformers pour vLLM atteint des performances natives
Hugging Face
L'intégration de Hugging Face Transformers comme backend de modélisation dans vLLM atteint ou dépasse désormais le débit natif de vLLM sur divers modèles Qwen3, y compris les architectures denses et mixture-of-experts, sans nécessiter de portage personnalisé. Ce résultat est obtenu grâce à des fusions de couches dynamiques à l'exécution via torch.fx et la manipulation de l'AST (arbre de syntaxe abstraite), permettant à tout modèle compatible de fonctionner à vitesse native avec un simple drapeau.
Depuis l'année dernière, la bibliothèque Hugging Face Transformers, qui prend en charge plus de 450 architectures, a été intégrée en tant que backend de modélisation dans vLLM, permettant aux auteurs de modèles d'exécuter les modèles Transformers dans vLLM sans avoir à les porter. La dernière itération de cette intégration permet désormais d'atteindre la vitesse d'inférence native de vLLM pour les modèles compatibles. Des benchmarks comparant le backend Transformers directement avec les implémentations natives de vLLM sur trois modèles Qwen3 (4B dense, 32B dense et 235B FP8 MoE) montrent que le backend Transformers atteint ou dépasse le débit natif dans tous les cas. L'amélioration des performances provient de l'application dynamique de fusions de couches spécifiques à l'inférence au moment de l'exécution, en utilisant torch.fx pour l'analyse statique et l'AST pour la manipulation du code source. Ces fusions incluent des opérations mappées sur les noyaux optimisés de vLLM pour la parallélisation des experts dans les modèles MoE, ainsi que des couches linéaires parallèles pour le parallélisme tensoriel et pipeline. Les modèles manipulés restent entièrement compilables avec torch.compile et CUDA Graphs. N'importe quel modèle Hugging Face peut être exécuté avec le simple drapeau --model-impl transformers, et il se combine avec les options de parallélisme existantes. Les modèles avec attention linéaire ne sont pas encore pris en charge, et les modèles personnalisés provenant des dépôts Hub ont peu de chances de fonctionner.
Source: Hugging Face blog —
original
