Hugging Face Transformers Backend für vLLM erreicht native Leistung
Hugging Face
Die Integration von Hugging Face Transformers als Modellierungs-Backend in vLLM erreicht nun native vLLM-Durchsatzraten über verschiedene Qwen3-Modelle hinweg, einschließlich dichter und Mixture-of-Experts-Architekturen, ohne dass ein benutzerdefinierter Port erforderlich ist. Dies wird durch dynamische Layer-Fusionen zur Laufzeit mittels torch.fx und AST-Manipulation erreicht, sodass jedes kompatible Modell mit nativer Geschwindigkeit mittels eines einzigen Flags ausgeführt werden kann.
Die Hugging-Face-Transformers-Bibliothek, die über 450 Architekturen unterstützt, ist seit letztem Jahr als Modellierungs-Backend in vLLM integriert. Dadurch können Modellautoren Transformers-Modelle in vLLM ausführen, ohne diese portieren zu müssen. Die neueste Version dieser Integration erreicht nun für kompatible Modelle die native vLLM-Inferenzgeschwindigkeit. Benchmarks, die das Transformers-Backend direkt mit den nativen vLLM-Implementierungen für drei Qwen3-Modelle (4B dicht, 32B dicht und 235B FP8 MoE) vergleichen, zeigen, dass das Transformers-Backend in allen Fällen den nativen Durchsatz erreicht oder übertrifft. Die Leistungssteigerung resultiert aus der dynamischen Anwendung inferenzspezifischer Layer-Fusionen zur Laufzeit, wobei torch.fx für die statische Analyse und AST für die Quellcode-Manipulation verwendet wird. Diese Fusionen umfassen Operationen, die auf vLLMs optimierte Kerne für die Expertenparallelisierung in MoE-Modellen abgebildet werden, sowie parallele lineare Layer für Tensor- und Pipeline-Parallelismus. Die manipulierten Modelle bleiben vollständig mit torch.compile und CUDA-Graphen kompilierbar. Jedes Hugging-Face-Modell kann mit dem einzelnen Flag --model-impl transformers ausgeführt werden und kombiniert sich mit vorhandenen Parallelisierungsoptionen. Modelle mit linearer Aufmerksamkeit werden noch nicht unterstützt, und benutzerdefinierte Modelle aus Hub-Repositories werden voraussichtlich nicht funktionieren.
Quelle: Hugging Face blog —
Original
