LLM Inference: From KV-Cache to Production Deployment
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
An experienced MLOps engineer from hh.ru explains how to efficiently run large language models on your own hardware in 2026. The article covers key technical aspects: KV-cache, inference engines vLLM and SGLang, the evolution of attention mechanisms, and practical recommendations for model selection, parallelism, and hardware for production.
Сайто Рыжов, MLOps-инженер в hh.ru, делится опытом развертывания больших языковых моделей (LLM) на собственном железе. Он объясняет, что эффективность инференса в первую очередь зависит от управления памятью видеокарты, а не от самой модели. Подробно разбирается KV-кэш, который переводит стадию декодирования из вычислительно-ограниченной (compute-bound) в ограниченную по памяти (memory-bound). Рассматриваются два основных фреймворка для инференса: vLLM с механизмом PagedAttention, решающим проблемы внутренней и внешней фрагментации, и SGLang с RadixAttention, реализующим более гибкое кэширование префиксов. Также описаны дополнительные возможности SGLang, такие как Compressed FSM для вызова функций, планировщик с учетом кэша (cache-aware scheduling) и dp-attention. Упомянута эволюция механизмов внимания: от многоголового внимания (MHA) через групповое запросное внимание (GQA) и многозапросное внимание (MLA) к динамическому разреженному вниманию (DSA) — каждый следующий шаг уменьшает размер KV-кэша. Даны практические рекомендации: для H100 и новее выбирать SGLang, для старых карт — vLLM; оптимальный размер модели — смесь экспертов (MoE) до 120 миллиардов параметров или плотная модель (Dense) до 32 миллиардов; для низкой задержки использовать тензорный параллелизм (Tensor Parallelism), для высокой пропускной способности — параллелизм данных (Data Parallelism); разделение префилла и декодирования дает максимальную пропускную способность, но требует больше инженерных ресурсов. Спекулятивное декодирование не рекомендуется для высоконагруженных систем, так как оно потребляет дополнительную память под черновую модель (draft model) и снижает общую пропускную способность.
出典: Habr — хаб ИИ —
原文
