Hugging Face Transformers Backend voor vLLM Bereikt Native Prestaties
Hugging Face
De integratie van Hugging Face Transformers als modelbackend in vLLM evenaart of overtreft nu de native vLLM-doorvoer bij verschillende Qwen3-modellen, waaronder dichte en mixture-of-experts architecturen, zonder dat er aangepaste portage nodig is. Dit wordt bereikt door dynamische laagfusies tijdens runtime met behulp van torch.fx en AST-manipulatie, waardoor elk compatibel model met native snelheid kan draaien met een enkele vlag.
De Hugging Face Transformers-bibliotheek, die meer dan 450 architecturen ondersteunt, is sinds vorig jaar geïntegreerd als een modelleringsbackend in vLLM. Hierdoor kunnen modelauteurs Transformers-modellen in vLLM uitvoeren zonder ze te hoeven overzetten. De nieuwste versie van deze integratie bereikt nu de native vLLM-inferentiesnelheid voor compatibele modellen. Uit benchmarks, waarbij de Transformers-backend rechtstreeks wordt vergeleken met de native implementaties van vLLM voor drie Qwen3-modellen (4B dense, 32B dense en 235B FP8 MoE), blijkt dat de Transformers-backend in alle gevallen de native doorvoer evenaart of overtreft. De prestatieverbetering komt door het dynamisch toepassen van inferentie-specifieke laagfusies tijdens runtime, met behulp van torch.fx voor statische analyse en AST voor broncodemanipulatie. Deze fusies omvatten bewerkingen die zijn toegewezen aan de geoptimaliseerde kernels van vLLM voor expert-parallelisatie in MoE-modellen, evenals parallelle lineaire lagen voor tensor- en pipeline-parallelisme. De gemanipuleerde modellen blijven volledig compileerbaar met torch.compile en CUDA Graphs. Elk Hugging Face-model kan worden uitgevoerd met de enkele vlag --model-impl transformers, en het werkt samen met bestaande parallellisme-opties. Modellen met lineaire aandacht worden nog niet ondersteund, en aangepaste modellen uit Hub-repositories zullen waarschijnlijk niet werken.
Bron: Hugging Face blog —
origineel
