Ray Serve

来自以下厂商的最新 AI 新闻、模型与发布: Ray Serve.

硬件与推理 🇷🇺

生产环境中的大语言模型推理性能退化:KV缓存、内存溢出与p99尾延迟

生产环境中的大语言模型推理常因KV缓存碎片化、长上下文导致的内存溢出、队头阻塞以及p99延迟尖峰而逐渐退化。VK Cloud布道师Stas Pogorzhelsky解释了导致性能衰退的四种机制,并提供了复现脚本和指标,以便在事故发生前发现这些问题。

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
最新新闻