Degradación de Inferencia de LLM en Producción: KV-cache, OOM y la Cola p99
La inferencia de LLM en producción a menudo se degrada gradualmente debido a la fragmentación del KV-cache, OOM en contextos largos, bloqueo de cabeza de línea y picos de latencia p99. El evangelista de VK Cloud, Stas Pogorzhelsky, explica cuatro mecanismos que causan el deterioro del rendimiento y ofrece scripts de reproducción y métricas para detectar problemas antes de que ocurran incidentes.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
