Hardware & Inferenz 🇷🇺 05.08.2026 04:04

LLM-Inferenzverschlechterung in der Produktion: KV-Cache, OOM und das p99-Perzentil

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Die LLM-Inferenz in der Produktion verschlechtert sich oft allmählich aufgrund von KV-Cache-Fragmentierung, Out-of-Memory-Fehlern bei langen Kontexten, Head-of-Line-Blocking und Latenzspitzen im p99-Perzentil. VK-Cloud-Evangelist Stas Pogorzhelsky erklärt vier Mechanismen, die zu Leistungsabfall führen, und bietet Reproduktionsskripte und Metriken, um Probleme zu erkennen, bevor sie zu Vorfällen führen.
Der Technologie-Evangelist von VK Cloud, Stas Pogorzhelsky, erklärt, dass die Inferenz großer Sprachmodelle in der Produktion normalerweise allmählich nachlässt und nicht sofort ausfällt. Er identifiziert vier Schlüsselmechanismen: KV-Cache-Fragmentierung, die zu 60-80 % Speicherverlust führt, OOM bei langen Kontexten, Head-of-Line-Blocking in Batches und die Divergenz von p50- und p99-Metriken. Der Artikel liefert Reproduktionsskripte und Metriken, um Probleme vor Incidents zu erkennen. Er hebt hervor, dass der KV-Cache in der Produktion oft die Modellgewichte übersteigt. PagedAttention reduziert die Fragmentierung auf weniger als 4 % und steigert den Durchsatz um das 2- bis 4-fache, aber externe Fragmentierung und Verdrängung verursachen im Laufe der Zeit weiterhin Probleme. Continuous Batching kann Head-of-Line-Blocking verursachen, wenn ein langer Prefill-Request kürzere Requests verzögert; Chunked Prefill mildert dies. Die FP8-Quantisierung des KV-Cache verdoppelt die effektive Speicherkapazität fast im Vergleich zu FP16. Es wird empfohlen, Trends bei Cache-Auslastung und Spitzen-KV zu überwachen, anstatt auf OOM zu warten.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten