Inferensi LLM: Dari KV-Cache hingga Deployment Produksi
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Insinyur MLOps dari hh.ru menjelaskan fundamental inferensi LLM pada perangkat keras on-premises. Artikel ini mencakup KV-cache, mesin inferensi vLLM dan SGLang, evolusi mekanisme perhatian (MHA, GQA, MLA, DSA), serta rekomendasi praktis untuk memilih perangkat keras dan skema paralelisme.
Artikel oleh insinyur MLOps Alexander Ryzhov dari hh.ru membahas tantangan dan solusi untuk menyebarkan model bahasa besar (LLM) di server sendiri. Wawasan utamanya adalah bahwa efisiensi inferensi didominasi oleh manajemen memori GPU. Cache KV menggeser tahap decode dari yang terikat komputasi menjadi terikat bandwidth memori. Penulis menjelaskan evolusi mekanisme perhatian: MHA (2017), GQA (2023), MLA (2024) oleh DeepSeek, dan DSA (2025) di DeepSeek v3.2, masing-masing mengurangi ukuran cache KV. Mesin inferensi vLLM (sumber terbuka) menggunakan PagedAttention untuk mengurangi fragmentasi memori, sementara SGLang (sumber terbuka) menggunakan RadixAttention untuk caching prefiks yang lebih fleksibel. Untuk perangkat keras, SGLang direkomendasikan untuk H100 dan yang lebih baru, vLLM untuk Ampere dan yang lebih lama. Titik optimal untuk satu node (8x H100, 640 GB VRAM) adalah model MoE hingga ~120B atau model padat hingga ~32B. Paralelisme Tensor (TP) menurunkan latensi, Paralelisme Data (DP) memaksimalkan throughput. Disagregasi Prefill/Decode memberikan throughput tertinggi tetapi membutuhkan lebih banyak rekayasa. Decoding spekulatif bukanlah obat mujarab karena menurun pada konkurensi tinggi. Artikel ini diakhiri dengan daftar periksa untuk penyebaran produksi.
Sumber: Habr — хаб ИИ —
asli
