Hugging Face Transformers를 vLLM 백엔드로 사용하여 네이티브 성능 달성
Hugging Face
Hugging Face Transformers를 vLLM의 모델링 백엔드로 통합한 결과, 다양한 Qwen3 모델(밀집 및 혼합 전문가 아키텍처 포함)에서 네이티브 vLLM 처리량과 같거나 더 높은 성능을 보였으며, 별도의 커스텀 포팅이 필요하지 않습니다. 이는 torch.fx와 AST 조작을 사용하여 런타임에 동적 레이어 융합을 수행함으로써 가능해졌으며, 호환 가능한 모든 모델을 단일 플래그만으로 네이티브 속도로 실행할 수 있습니다.
작년부터 450개 이상의 아키텍처를 지원하는 Hugging Face Transformers 라이브러리가 vLLM의 모델링 백엔드로 통합되면서, 모델 작성자가 별도의 이식 작업 없이 Transformers 모델을 vLLM 내에서 실행할 수 있게 되었습니다. 이번 최신 통합 버전에서는 호환 가능한 모델에 대해 네이티브 vLLM 추론 속도를 달성합니다. 세 가지 Qwen3 모델(4B Dense, 32B Dense, 235B FP8 Mixture-of-Experts, 즉 MoE)을 대상으로 Transformers 백엔드와 vLLM 네이티브 구현을 직접 비교한 벤치마크 결과, Transformers 백엔드가 모든 경우에서 네이티브 처리량을 충족하거나 능가하는 것으로 나타났습니다. 성능 향상은 torch.fx를 이용한 정적 분석과 추상 구문 트리(Abstract Syntax Tree, 즉 AST)를 통한 소스 코드 변형을 사용하여, 런타임에 추론에 특화된 레이어 퓨전을 동적으로 적용함으로써 이루어집니다. 이러한 퓨전에는 MoE 모델의 전문가 병렬화를 위한 vLLM 최적화 커널에 매핑된 연산과, 텐서 및 파이프라인 병렬 처리를 위한 병렬 선형 레이어가 포함됩니다. 변형된 모델은 torch.compile 및 CUDA 그래프와 완전히 호환되며 컴파일이 가능합니다. 모든 Hugging Face 모델은 단일 플래그 --model-impl transformers 로 실행할 수 있으며, 기존 병렬 처리 옵션과도 연동됩니다. 선형 어텐션(Linear Attention)을 사용하는 모델은 아직 지원되지 않으며, Hub 리포지토리의 커스텀 모델은 작동하지 않을 가능성이 높습니다.
출처: Hugging Face blog —
원문
