Hardware & Inferentie 🇷🇺 27.07.2026 09:02

LLM-inferentie: Van KV-Cache tot Productie-implementatie

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Een MLOps-ingenieur van hh.ru legt de grondbeginselen van LLM-inferentie op on-premises hardware uit. Het artikel behandelt KV-cache, inferentie-engines vLLM en SGLang, de evolutie van aandachtsmechanismen (MHA, GQA, MLA, DSA) en praktische aanbevelingen voor het kiezen van hardware en parallelle schema's.
Het artikel van MLOps-ingenieur Alexander Ryzhov van hh.ru bespreekt de uitdagingen en oplossingen voor het implementeren van grote taalmodellen (large language models, LLM's) op eigen servers. De belangrijkste conclusie is dat de efficiëntie van inferentie wordt gedomineerd door het beheer van het GPU-geheugen. KV-cache verschuift de decodeerfase van compute-gebonden naar geheugenbandbreedte-gebonden. De auteur legt de evolutie van aandachtsmechanismen uit: MHA (2017), GQA (2023), MLA (2024) van DeepSeek, en DSA (2025) in DeepSeek v3.2. Elk van deze mechanismen verkleint de grootte van de KV-cache. Inferentieënigines vLLM (open-source) gebruikt PagedAttention om geheugenfragmentatie te verminderen, terwijl SGLang (open-source) RadixAttention gebruikt voor flexibelere prefix-caching. Voor hardware wordt SGLang aanbevolen voor H100 en hoger, en vLLM voor Ampere en ouder. De ideale configuratie voor één node (8x H100, 640 GB VRAM) zijn MoE-modellen tot ~120B of dichte modellen tot ~32B. Tensor Parallelism (TP) verlaagt de latentie, Data Parallelism (DP) maximaliseert de doorvoer. Het scheiden van prefill en decode (Prefill/Decode disaggregation) geeft de hoogste doorvoer, maar vereist meer technische inspanning. Speculatieve decodering is geen wondermiddel, omdat het prestaties verslechtert bij hoge gelijktijdigheid. Het artikel sluit af met een checklist voor productie-implementatie.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws