Código AbertoHardware e Inferência 🇺🇸 27.07.2026 04:05

Backend Hugging Face Transformers para vLLM Atinge Performance Nativa

Hugging FaceHugging Face
A integração do Hugging Face Transformers como backend de modelagem no vLLM agora iguala ou supera a taxa de transferência nativa do vLLM em vários modelos Qwen3, incluindo arquiteturas densas e de mistura de especialistas, sem exigir portabilidade personalizada. Isso é alcançado por meio de fusões dinâmicas de camadas em tempo de execução usando torch.fx e manipulação de AST, permitindo que qualquer modelo compatível seja executado em velocidade nativa com um único sinalizador.
A biblioteca Hugging Face Transformers, que suporta mais de 450 arquiteturas, foi integrada como um backend de modelagem no vLLM desde o ano passado, permitindo que autores de modelos executem modelos Transformers dentro do vLLM sem necessidade de portabilidade. A iteração mais recente dessa integração agora alcança velocidade de inferência nativa do vLLM para modelos compatíveis. Benchmarks comparando o backend Transformers diretamente com as implementações nativas do vLLM em três modelos Qwen3 (4B denso, 32B denso e 235B FP8 MoE) mostram que o backend Transformers atende ou supera a taxa de transferência nativa em todos os casos. A melhoria de desempenho vem da aplicação dinâmica de fusões de camadas específicas para inferência em tempo de execução, usando torch.fx para análise estática e AST para manipulação de código-fonte. Essas fusões incluem operações mapeadas para kernels otimizados do vLLM para paralelização de especialistas em modelos MoE, bem como camadas lineares paralelas para paralelismo de tensor e pipeline. Os modelos manipulados permanecem totalmente compiláveis com torch.compile e CUDA Graphs. Qualquer modelo Hugging Face pode ser executado com o único flag --model-impl transformers, e ele se compõe com as opções de paralelismo existentes. Modelos com atenção linear ainda não são suportados, e modelos personalizados de repositórios Hub provavelmente não funcionarão.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas