Hardware e Inferência RSS

Código Aberto 🇺🇸

Backend Hugging Face Transformers para vLLM Atinge Performance Nativa

A integração do Hugging Face Transformers como backend de modelagem no vLLM agora iguala ou supera a taxa de transferência nativa do vLLM em vários modelos Qwen3, incluindo arquiteturas densas e de mistura de especialistas, sem exigir portabilidade personalizada. Isso é alcançado por meio de fusões dinâmicas de camadas em tempo de execução usando torch.fx e manipulação de AST, permitindo que qualquer modelo compatível seja executado em velocidade nativa com um único sinalizador.

Hugging FaceHugging Face
Hugging Face blog27.07 · 04:05
Notícias frescas