Ray Serve

Últimas noticias, modelos y lanzamientos de IA de Ray Serve.

Degradación de Inferencia de LLM en Producción: KV-cache, OOM y la Cola p99

La inferencia de LLM en producción a menudo se degrada gradualmente debido a la fragmentación del KV-cache, OOM en contextos largos, bloqueo de cabeza de línea y picos de latencia p99. El evangelista de VK Cloud, Stas Pogorzhelsky, explica cuatro mecanismos que causan el deterioro del rendimiento y ofrece scripts de reproducción y métricas para detectar problemas antes de que ocurran incidentes.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Noticias frescas