Degradação de Inferência de LLM em Produção: KV-cache, OOM e a Cauda p99
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
A inferência de LLM em produção frequentemente degrada gradualmente devido à fragmentação do KV-cache, OOM em contextos longos, bloqueio head-of-line e picos de latência p99. O evangelista da VK Cloud, Stas Pogorzhelsky, explica quatro mecanismos que causam a decadência de desempenho e oferece scripts de reprodução e métricas para detectar problemas antes de incidentes.
O evangelista de tecnologia da VK Cloud, Stas Pogorzhelsky, explica que a inferência de LLM em produção geralmente degrada gradualmente, em vez de falhar imediatamente. Ele identifica quatro mecanismos-chave: fragmentação do cache KV causando perda de 60-80% da memória, OOM em contextos longos, bloqueio head-of-line em lotes e divergência das métricas p50/p99. O artigo fornece scripts de reprodução e métricas para detectar problemas antes de incidentes. Ele destaca que o cache KV frequentemente excede o peso do modelo em produção. O PagedAttention reduz a fragmentação para menos de 4% e aumenta a taxa de transferência em 2-4x, mas a fragmentação externa e a evicção ainda causam problemas ao longo do tempo. O batching contínuo pode causar bloqueio head-of-line quando uma solicitação de prefill longa atrasa as mais curtas; o prefill dividido em blocos (chunked prefill) mitiga isso. A quantização FP8 do cache KV quase dobra a capacidade efetiva de memória em comparação com FP16. Recomenda-se monitorar tendências no uso do cache e no pico de KV, em vez de esperar por OOM.
Fonte: Habr — хаб ИИ —
original
