Backend Hugging Face Transformers para vLLM Atinge Performance Nativa
A integração do Hugging Face Transformers como backend de modelagem no vLLM agora iguala ou supera a taxa de transferência nativa do vLLM em vários modelos Qwen3, incluindo arquiteturas densas e de mistura de especialistas, sem exigir portabilidade personalizada. Isso é alcançado por meio de fusões dinâmicas de camadas em tempo de execução usando torch.fx e manipulação de AST, permitindo que qualquer modelo compatível seja executado em velocidade nativa com um único sinalizador.
Hugging Face



