硬件与推理 RSS

开源 🇺🇸

Hugging Face Transformers 后端集成至 vLLM,实现原生性能

在 vLLM 中将 Hugging Face Transformers 作为建模后端集成后,现在各类 Qwen3 模型(包括密集型和混合专家架构)的吞吐量可匹配或超越原生 vLLM,无需自定义移植。这是通过使用 torch.fx 和 AST 操作在运行时进行动态层融合实现的,允许任何兼容模型通过单个标志以原生速度运行。

Hugging FaceHugging Face
Hugging Face blog27.07 · 04:05
最新新闻