开源硬件与推理 🇺🇸 27.07.2026 04:05

Hugging Face Transformers 后端集成至 vLLM,实现原生性能

Hugging FaceHugging Face
在 vLLM 中将 Hugging Face Transformers 作为建模后端集成后,现在各类 Qwen3 模型(包括密集型和混合专家架构)的吞吐量可匹配或超越原生 vLLM,无需自定义移植。这是通过使用 torch.fx 和 AST 操作在运行时进行动态层融合实现的,允许任何兼容模型通过单个标志以原生速度运行。
Hugging Face Transformers 库支持超过 450 种架构,自去年起已作为建模后端集成到 vLLM 中,使模型作者无需移植即可在 vLLM 内运行 Transformers 模型。这一集成的最新迭代版本现已为兼容模型实现原生 vLLM 推理速度。基准测试将 Transformers 后端与 vLLM 原生实现在三个 Qwen3 模型(4B 密集模型、32B 密集模型和 235B FP8 MoE 模型)上进行逐项对比,结果显示 Transformers 后端在所有情况下均达到或超过原生吞吐量。性能提升源于在运行时动态应用推理特定层融合,使用 torch.fx 进行静态分析,并使用抽象语法树进行源代码操作。这些融合包括映射到 vLLM 优化内核的操作,用于 MoE 模型中的专家并行化,以及用于张量和流水线并行的并行线性层。被操作的模型完全可与 torch.compile 和 CUDA Graphs 一起编译。任何 Hugging Face 模型均可通过单个标志 --model-impl transformers 运行,并与现有并行选项组合使用。尚不支持具有线性注意力的模型,且来自 Hub 仓库的自定义模型不太可能正常工作。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻