LLM Inference: From KV-Cache to Production Deployment
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
An experienced MLOps engineer from hh.ru explains how to efficiently run large language models on your own hardware in 2026. The article covers key technical aspects: KV-cache, inference engines vLLM and SGLang, the evolution of attention mechanisms, and practical recommendations for model selection, parallelism, and hardware for production.
Саша Рыжов, hh.ru के MLOps इंजीनियर, अपने हार्डवेयर पर LLM को तैनात करने का अनुभव साझा करते हैं। वे बताते हैं कि इन्फरेंस की दक्षता मुख्य रूप से GPU मेमोरी प्रबंधन पर निर्भर करती है, न कि मॉडल पर। KV-कैश का विस्तार से विश्लेषण किया गया है, जो डिकोड चरण को compute-bound से memory-bound में बदल देता है। इन्फरेंस के लिए दो मुख्य फ्रेमवर्क पर चर्चा की गई है: vLLM, जिसमें PagedAttention तंत्र है जो internal और external fragmentation की समस्याओं को हल करता है, और SGLang, जिसमें RadixAttention है जो अधिक लचीला प्रीफिक्स कैशिंग प्रदान करता है। SGLang की अतिरिक्त क्षमताएं भी बताई गई हैं, जैसे function calling के लिए Compressed FSM, cache-aware scheduling और dp-attention। अटेंशन मैकेनिज्म के विकास का उल्लेख किया गया है: MHA से GQA और MLA होते हुए DSA तक - प्रत्येक चरण KV-कैश के आकार को कम करता है। व्यावहारिक सुझाव दिए गए हैं: H100 और नए के लिए SGLang चुनें, पुराने GPU के लिए vLLM; इष्टतम मॉडल आकार MoE 120B तक या Dense 32B तक; कम विलंबता के लिए Tensor Parallelism का उपयोग करें, उच्च थ्रूपुट के लिए Data Parallelism; prefill और decode को अलग करने से अधिकतम थ्रूपुट मिलता है, लेकिन अधिक इंजीनियरिंग संसाधनों की आवश्यकता होती है। उच्च लोड वाले सिस्टम के लिए स्पेक्युलेटिव डिकोडिंग की अनुशंसा नहीं की जाती, क्योंकि यह ड्राफ्ट मॉडल के लिए अतिरिक्त मेमोरी की खपत करता है और समग्र थ्रूपुट को कम करता है।
स्रोत: Habr — хаб ИИ —
मूल
