Penurunan Kinerja Inferensi LLM di Produksi: KV-cache, OOM, dan Ekor p99
Inferensi LLM di produksi sering kali menurun secara bertahap akibat fragmentasi KV-cache, OOM pada konteks panjang, pemblokiran head-of-line, dan lonjakan latensi p99. Penginjil VK Cloud, Stas Pogorzhelsky, menjelaskan empat mekanisme yang menyebabkan penurunan kinerja dan menawarkan skrip reproduksi serta metrik untuk menangkap masalah sebelum terjadi insiden.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
