Transformers-бэкенд для vLLM достигает скорости нативных реализаций
Hugging Face
Интеграция библиотеки transformers в качестве бэкенда для vLLM обновлена: теперь она динамически применяет оптимизации на уровне графа модели, достигая производительности, сопоставимой с ручными реализациями vLLM. Для запуска любой модели Hugging Face достаточно указать флаг --model-impl transformers.
Библиотека transformers, которая поддерживает более 450 архитектур, уже год используется как моделирующий бэкенд в vLLM, позволяя запускать модели без портирования. Ранее для максимальной производительности требовались ручные реализации vLLM, но последнее обновление устраняет этот разрыв. Теперь бэкенд с помощью torch.fx анализирует граф модели и с использованием AST (абстрактное синтаксическое дерево) переписывает операции, заменяя их на оптимизированные ядра vLLM. В результате для совместимых архитектур достигается скорость нативной реализации vLLM. Бенчмарки показали, что бэкенд transformers не уступает или превосходит нативные реализации vLLM на трёх моделях Qwen3: 4B, 32B и 235B MoE FP8. Для запуска достаточно флага --model-impl transformers, при этом поддерживаются стандартные опции параллелизма, такие как тензорный, экспертный и конвейерный параллелизм. В отличие от реализаций vLLM, модели transformers остаются пригодными для обучения.
- Сокращения
- vLLM = virtual Large Language Model — виртуальная большая языковая модель
- API = Application Programming Interface — интерфейс программирования приложений
- GPU = Graphics Processing Unit — графический процессор
- FP8 = Floating Point 8-bit — 8-разрядная плавающая точка
- MoE = Mixture of Experts — смесь экспертов
- TP = Tensor Parallelism — тензорный параллелизм
- PP = Pipeline Parallelism — конвейерный параллелизм
- EP = Expert Parallelism — экспертный параллелизм
- AST = Abstract Syntax Tree — абстрактное синтаксическое дерево
- CUDA = Compute Unified Device Architecture — вычислительная унифицированная архитектура устройств
- RL = Reinforcement Learning — обучение с подкреплением
- PR = Pull Request — запрос на слияние
Источник: Hugging Face blog —
оригинал
