Text Generation Inference (TGI)

Laatste AI-nieuws, modellen en releases van Text Generation Inference (TGI).

LLM-inferentieverslechtering in productie: KV-cache, OOM en de p99-tail

Productie-LLM-inferentie verslechtert vaak geleidelijk door KV-cache-fragmentatie, OOM bij lange contexten, head-of-line blocking en p99-latentiepieken. VK Cloud-evangelist Stas Pogorzhelsky legt vier mechanismen uit die prestatieverval veroorzaken en biedt reproduktiescripts en metrieken om problemen te detecteren voordat ze incidenten worden.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Vers nieuws