Backend Hugging Face Transformers cho vLLM đạt hiệu suất gốc
Hugging Face
Việc tích hợp Hugging Face Transformers làm backend mô hình hóa trong vLLM hiện đạt hoặc vượt thông lượng gốc của vLLM trên nhiều mô hình Qwen3 khác nhau, bao gồm kiến trúc dense và hỗn hợp chuyên gia (mixture-of-experts), mà không cần chuyển đổi tùy chỉnh. Điều này đạt được thông qua các hợp nhất lớp động tại thời gian chạy sử dụng torch.fx và thao tác AST, cho phép bất kỳ mô hình tương thích nào chạy ở tốc độ gốc chỉ với một cờ duy nhất.
Hugging Face Transformers, thư viện hỗ trợ hơn 450 kiến trúc, đã được tích hợp làm backend mô hình hóa trong vLLM từ năm ngoái, cho phép các tác giả mô hình chạy mô hình Transformers bên trong vLLM mà không cần porting. Phiên bản mới nhất của sự tích hợp này hiện đạt tốc độ suy luận vLLM gốc cho các mô hình tương thích. Các bài kiểm tra so sánh trực tiếp backend Transformers với các triển khai gốc của vLLM trên ba mô hình Qwen3 (4B dense, 32B dense và 235B FP8 MoE) cho thấy backend Transformers đạt hoặc vượt throughput gốc trong mọi trường hợp. Sự cải thiện hiệu năng đến từ việc áp dụng động các hợp nhất lớp dành riêng cho suy luận tại thời gian chạy, sử dụng torch.fx để phân tích tĩnh và AST để thao tác mã nguồn. Các hợp nhất này bao gồm các phép toán ánh xạ tới các kernel tối ưu hóa của vLLM cho việc song song hóa chuyên gia trong mô hình MoE, cũng như các lớp tuyến tính song song cho tensor và pipeline parallelism. Các mô hình được thao tác vẫn hoàn toàn có thể biên dịch với torch.compile và CUDA Graphs. Bất kỳ mô hình Hugging Face nào cũng có thể chạy với cờ duy nhất --model-impl transformers, và nó kết hợp với các tùy chọn song song hóa hiện có. Các mô hình có attention tuyến tính chưa được hỗ trợ, và các mô hình tùy chỉnh từ kho Hub khó có thể hoạt động.
Nguồn: Hugging Face blog —
bản gốc
