Hardware e Inferencia 🇷🇺 05.08.2026 04:04

Degradación de Inferencia de LLM en Producción: KV-cache, OOM y la Cola p99

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
La inferencia de LLM en producción a menudo se degrada gradualmente debido a la fragmentación del KV-cache, OOM en contextos largos, bloqueo de cabeza de línea y picos de latencia p99. El evangelista de VK Cloud, Stas Pogorzhelsky, explica cuatro mecanismos que causan el deterioro del rendimiento y ofrece scripts de reproducción y métricas para detectar problemas antes de que ocurran incidentes.
El evangelista tecnológico de VK Cloud, Stas Pogorzhelsky, explica que la inferencia de LLM en producción suele degradarse gradualmente en lugar de fallar de inmediato. Identifica cuatro mecanismos clave: la fragmentación de la caché KV que causa una pérdida de memoria del 60-80%, OOM en contextos largos, el bloqueo de cabeza de línea en lotes y la divergencia de métricas p50/p99. El artículo proporciona scripts de reproducción y métricas para detectar problemas antes de que ocurran incidentes. Destaca que la caché KV a menudo supera los pesos del modelo en producción. PagedAttention reduce la fragmentación a menos del 4% y aumenta el rendimiento de 2 a 4 veces, pero la fragmentación externa y la expulsión siguen causando problemas con el tiempo. El batching continuo puede causar bloqueo de cabeza de línea cuando una solicitud de prefill larga retrasa las más cortas; el prefill fragmentado mitiga esto. La cuantización FP8 de la caché KV casi duplica la capacidad efectiva de memoria en comparación con FP16. Se aconseja monitorear las tendencias en el uso de caché y el pico de KV en lugar de esperar a que ocurra OOM.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas