Perangkat Keras & Inferensi 🇷🇺 27.07.2026 09:02

LLM Inference: From KV-Cache to Production Deployment

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
An experienced MLOps engineer from hh.ru explains how to efficiently run large language models on your own hardware in 2026. The article covers key technical aspects: KV-cache, inference engines vLLM and SGLang, the evolution of attention mechanisms, and practical recommendations for model selection, parallelism, and hardware for production.
Sasha Ryzhov, MLOps engineer di hh.ru, membagikan pengalamannya dalam menyebarkan Large Language Model (LLM) di perangkat keras sendiri. Ia menjelaskan bahwa efisiensi inferensi terutama bergantung pada manajemen memori kartu grafis, bukan pada model itu sendiri. KV-cache dibahas secara rinci, yang mengubah tahap dekode dari compute-bound menjadi memory-bound. Dua kerangka kerja utama untuk inferensi dibahas: vLLM dengan mekanisme PagedAttention yang mengatasi masalah fragmentasi internal dan eksternal, serta SGLang dengan RadixAttention yang menerapkan caching prefiks yang lebih fleksibel. Fitur tambahan SGLang juga dijelaskan, seperti Compressed Finite State Machine (FSM) untuk function calling, cache-aware scheduling, dan dp-attention. Evolusi mekanisme atensi disebutkan: dari Multi-Head Attention (MHA) melalui Grouped Query Attention (GQA) dan Multi-Query Attention (MQA) hingga Dynamic Sparse Attention (DSA) — setiap langkah berikutnya mengurangi ukuran KV-cache. Rekomendasi praktis diberikan: untuk H100 dan yang lebih baru pilih SGLang, untuk kartu lama gunakan vLLM; ukuran model optimal adalah Mixture of Experts (MoE) hingga 120 miliar parameter atau Dense hingga 32 miliar parameter; untuk latensi rendah gunakan Tensor Parallelism (TP), untuk throughput tinggi gunakan Data Parallelism (DP); pemisahan prefill dan dekode memberikan throughput maksimum tetapi membutuhkan lebih banyak sumber daya rekayasa. Decoding spekulatif tidak direkomendasikan untuk sistem dengan beban tinggi karena memakan memori tambahan untuk draft model dan menurunkan throughput keseluruhan.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru