FasterTransformer

Neueste KI-Nachrichten, Modelle und Releases von FasterTransformer.

LLM-Inferenzverschlechterung in der Produktion: KV-Cache, OOM und das p99-Perzentil

Die LLM-Inferenz in der Produktion verschlechtert sich oft allmählich aufgrund von KV-Cache-Fragmentierung, Out-of-Memory-Fehlern bei langen Kontexten, Head-of-Line-Blocking und Latenzspitzen im p99-Perzentil. VK-Cloud-Evangelist Stas Pogorzhelsky erklärt vier Mechanismen, die zu Leistungsabfall führen, und bietet Reproduktionsskripte und Metriken, um Probleme zu erkennen, bevor sie zu Vorfällen führen.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Aktuelle Nachrichten