Hardware & Inferenz 🇷🇺 27.07.2026 09:02

LLM-Inferenz: Vom KV-Cache bis zur Produktionsbereitstellung

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Ein MLOps-Ingenieur von hh.ru erklärt die Grundlagen der LLM-Inferenz auf lokaler Hardware. Der Artikel behandelt KV-Cache, Inferenz-Engines vLLM und SGLang, die Entwicklung von Aufmerksamkeitsmechanismen (MHA, GQA, MLA, DSA) sowie praktische Empfehlungen zur Auswahl von Hardware und Parallelisierungsschemata.
Der Artikel von MLOps-Ingenieur Alexander Ryzhov von hh.ru diskutiert die Herausforderungen und Lösungen für das Bereitstellen großer Sprachmodelle (Large Language Models, LLMs) auf eigenen Servern. Die wichtigste Erkenntnis ist, dass die Inferenzeffizienz von der GPU-Speicherverwaltung dominiert wird. Der KV-Cache verschiebt die Dekodierphase von rechenintensiv zu speicherbandbreitenbegrenzt. Der Autor erklärt die Entwicklung der Aufmerksamkeitsmechanismen: Multi-Head Attention (MHA, 2017), Grouped Query Attention (GQA, 2023), Multi-Head Latent Attention (MLA, 2024) von DeepSeek und Dual-Stream Attention (DSA, 2025) in DeepSeek v3.2, die jeweils die KV-Cache-Größe reduzieren. Inferenz-Engines: vLLM (Open Source) verwendet PagedAttention, um Speicherfragmentierung zu reduzieren, während SGLang (Open Source) RadixAttention für ein flexibleres Prefix-Caching einsetzt. Für die Hardware wird SGLang für H100 und neuer empfohlen, vLLM für Ampere und älter. Der Sweet Spot für einen Knoten (8x H100, 640 GB VRAM) liegt bei Mixture-of-Experts (MoE)-Modellen bis zu etwa 120B oder dichten Modellen bis zu etwa 32B. Tensor-Parallelismus (TP) senkt die Latenz, Datenparallelismus (DP) maximiert den Durchsatz. Die Trennung von Prefill und Decode (Prefill/Decode Disaggregation) bietet den höchsten Durchsatz, erfordert aber mehr Entwicklungsaufwand. Spekulative Dekodierung ist kein Allheilmittel, da sie bei hoher Nebenläufigkeit (Concurrency) an Leistung verliert. Der Artikel schließt mit einer Checkliste für den Produktionseinsatz.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten