Perangkat Keras & Inferensi 🇷🇺 27.07.2026 09:02

Inferensi LLM: Dari KV-Cache hingga Deployment Produksi

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Insinyur MLOps dari hh.ru menjelaskan fundamental inferensi LLM pada perangkat keras on-premises. Artikel ini mencakup KV-cache, mesin inferensi vLLM dan SGLang, evolusi mekanisme perhatian (MHA, GQA, MLA, DSA), serta rekomendasi praktis untuk memilih perangkat keras dan skema paralelisme.
Artikel oleh insinyur MLOps Alexander Ryzhov dari hh.ru membahas tantangan dan solusi untuk menyebarkan model bahasa besar (LLM) di server sendiri. Wawasan utamanya adalah bahwa efisiensi inferensi didominasi oleh manajemen memori GPU. Cache KV menggeser tahap decode dari yang terikat komputasi menjadi terikat bandwidth memori. Penulis menjelaskan evolusi mekanisme perhatian: MHA (2017), GQA (2023), MLA (2024) oleh DeepSeek, dan DSA (2025) di DeepSeek v3.2, masing-masing mengurangi ukuran cache KV. Mesin inferensi vLLM (sumber terbuka) menggunakan PagedAttention untuk mengurangi fragmentasi memori, sementara SGLang (sumber terbuka) menggunakan RadixAttention untuk caching prefiks yang lebih fleksibel. Untuk perangkat keras, SGLang direkomendasikan untuk H100 dan yang lebih baru, vLLM untuk Ampere dan yang lebih lama. Titik optimal untuk satu node (8x H100, 640 GB VRAM) adalah model MoE hingga ~120B atau model padat hingga ~32B. Paralelisme Tensor (TP) menurunkan latensi, Paralelisme Data (DP) memaksimalkan throughput. Disagregasi Prefill/Decode memberikan throughput tertinggi tetapi membutuhkan lebih banyak rekayasa. Decoding spekulatif bukanlah obat mujarab karena menurun pada konkurensi tinggi. Artikel ini diakhiri dengan daftar periksa untuk penyebaran produksi.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru