Бэкенд Hugging Face Transformers для vLLM достигает нативной производительности

Hugging FaceHugging Face
Интеграция Hugging Face Transformers в качестве моделирующего бэкенда в vLLM теперь соответствует или превышает нативную пропускную способность vLLM для различных моделей Qwen3, включая плотные и смесевые экспертные архитектуры, без необходимости пользовательского портирования. Это достигается с помощью динамических слияний слоёв во время выполнения с использованием torch.fx и манипуляции абстрактным синтаксическим деревом (AST), что позволяет любой совместимой модели работать на нативной скорости с помощью одного флага.
Библиотека Hugging Face Transformers, поддерживающая более 450 архитектур, с прошлого года интегрирована в качестве бэкенда для моделирования в vLLM, что позволяет авторам моделей запускать модели Transformers внутри vLLM без портирования. Последняя версия этой интеграции теперь достигает нативных скоростей инференса vLLM для совместимых моделей. Сравнительные тесты бэкенда Transformers с
Показать ещё ↓
Источник: Hugging Face blog — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости