Dégradation de l'inférence des LLM en production : cache KV, OOM et latence p99
L'inférence des LLM en production se dégrade souvent progressivement en raison de la fragmentation du cache KV, des dépassements de mémoire (OOM) sur les contextes longs, du blocage de tête de file et des pics de latence p99. L'évangéliste de VK Cloud, Stas Pogorzhelsky, explique quatre mécanismes à l'origine de la dégradation des performances et propose des scripts de reproduction et des métriques pour détecter les problèmes avant les incidents.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
