LLM-inferentieverslechtering in productie: KV-cache, OOM en de p99-tail
Productie-LLM-inferentie verslechtert vaak geleidelijk door KV-cache-fragmentatie, OOM bij lange contexten, head-of-line blocking en p99-latentiepieken. VK Cloud-evangelist Stas Pogorzhelsky legt vier mechanismen uit die prestatieverval veroorzaken en biedt reproduktiescripts en metrieken om problemen te detecteren voordat ze incidenten worden.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
