Ray Serve

Berita AI terbaru, model, dan rilis dari Ray Serve.

Penurunan Kinerja Inferensi LLM di Produksi: KV-cache, OOM, dan Ekor p99

Inferensi LLM di produksi sering kali menurun secara bertahap akibat fragmentasi KV-cache, OOM pada konteks panjang, pemblokiran head-of-line, dan lonjakan latensi p99. Penginjil VK Cloud, Stas Pogorzhelsky, menjelaskan empat mekanisme yang menyebabkan penurunan kinerja dan menawarkan skrip reproduksi serta metrik untuk menangkap masalah sebelum terjadi insiden.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Berita terbaru