Hardware & Inferentie 🇷🇺 05.08.2026 04:04

LLM-inferentieverslechtering in productie: KV-cache, OOM en de p99-tail

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Productie-LLM-inferentie verslechtert vaak geleidelijk door KV-cache-fragmentatie, OOM bij lange contexten, head-of-line blocking en p99-latentiepieken. VK Cloud-evangelist Stas Pogorzhelsky legt vier mechanismen uit die prestatieverval veroorzaken en biedt reproduktiescripts en metrieken om problemen te detecteren voordat ze incidenten worden.
VK Cloud-technologie-evangelist Stas Pogorzhelsky legt uit dat inferentie met grote taalmodellen in productie doorgaans geleidelijk verslechtert in plaats van onmiddellijk te falen. Hij identificeert vier belangrijke mechanismen: KV-cachefragmentatie die 60-80% geheugenverlies veroorzaakt, out-of-memory (OOM) bij lange contexten, head-of-line-blocking in batches en divergentie van p50/p99-metrieken. Het artikel biedt reproductiescripts en metrieken om problemen te signaleren voordat er incidenten optreden. Het benadrukt dat de KV-cache in productie vaak groter is dan de modelgewichten. PagedAttention vermindert fragmentatie tot minder dan 4% en verhoogt de doorvoer met 2-4x, maar externe fragmentatie en verwijdering veroorzaken na verloop van tijd nog steeds problemen. Continue batching kan head-of-line-blocking veroorzaken wanneer een lange prefetch-aanvraag kortere aanvragen vertraagt; chunked prefill vermindert dit. FP8-kwantificering van de KV-cache verdubbelt bijna de effectieve geheugencapaciteit vergeleken met FP16. Het wordt aanbevolen om trends in cachegebruik en piek-KV te monitoren in plaats van te wachten op OOM.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws