LLM-Inferenzverschlechterung in der Produktion: KV-Cache, OOM und das p99-Perzentil
Die LLM-Inferenz in der Produktion verschlechtert sich oft allmählich aufgrund von KV-Cache-Fragmentierung, Out-of-Memory-Fehlern bei langen Kontexten, Head-of-Line-Blocking und Latenzspitzen im p99-Perzentil. VK-Cloud-Evangelist Stas Pogorzhelsky erklärt vier Mechanismen, die zu Leistungsabfall führen, und bietet Reproduktionsskripte und Metriken, um Probleme zu erkennen, bevor sie zu Vorfällen führen.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
