Degradação de Inferência de LLM em Produção: KV-cache, OOM e a Cauda p99
A inferência de LLM em produção frequentemente degrada gradualmente devido à fragmentação do KV-cache, OOM em contextos longos, bloqueio head-of-line e picos de latência p99. O evangelista da VK Cloud, Stas Pogorzhelsky, explica quatro mecanismos que causam a decadência de desempenho e oferece scripts de reprodução e métricas para detectar problemas antes de incidentes.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
