нативными реализациями vLLM на трех моделях Qwen3 (4B плотная, 32B плотная и 235B FP8 смесь экспертов) показывают, что бэкенд Transformers во всех случаях достигает или превосходит нативную пропускную способность. Улучшение производительности достигается за счет динамического применения слияний слоев, специфичных для инференса, во время выполнения с использованием torch.fx для статического анализа и абстрактного синтаксического дерева для манипуляции исходным кодом. Эти слияния включают операции, сопоставленные с оптимизированными ядрами vLLM для распараллеливания экспертов в моделях смеси экспертов, а также параллельные линейные слои для тензорного и конвейерного параллелизма. Модифицированные модели остаются полностью компилируемыми с помощью torch.compile и CUDA Graphs. Любая модель Hugging Face может быть запущена с единственным флагом --model-impl transformers, и это сочетается с существующими опциями параллелизма. Модели с линейным вниманием пока не поддерживаются, а кастомные модели из репозиториев Hub вряд ли будут работать.