Penurunan Kinerja Inferensi LLM di Produksi: KV-cache, OOM, dan Ekor p99
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Inferensi LLM di produksi sering kali menurun secara bertahap akibat fragmentasi KV-cache, OOM pada konteks panjang, pemblokiran head-of-line, dan lonjakan latensi p99. Penginjil VK Cloud, Stas Pogorzhelsky, menjelaskan empat mekanisme yang menyebabkan penurunan kinerja dan menawarkan skrip reproduksi serta metrik untuk menangkap masalah sebelum terjadi insiden.
Evangelis teknologi VK Cloud, Stas Pogorzhelsky, menjelaskan bahwa inferensi LLM dalam produksi biasanya menurun secara bertahap, bukan langsung gagal. Ia mengidentifikasi empat mekanisme kunci: fragmentasi KV-cache yang menyebabkan kehilangan memori 60-80%, OOM pada konteks panjang, kepala-antrian (head-of-line) blocking dalam batch, dan divergensi metrik p50/p99. Artikel ini menyediakan skrip reproduksi dan metrik untuk menangkap masalah sebelum insiden terjadi. Artikel ini menyoroti bahwa KV-cache sering kali melebihi bobot model dalam produksi. PagedAttention mengurangi fragmentasi hingga kurang dari 4% dan meningkatkan throughput 2-4 kali lipat, tetapi fragmentasi eksternal dan eviction masih menyebabkan masalah seiring waktu. Continuous batching dapat menyebabkan kepala-antrian blocking ketika permintaan prefill yang panjang menunda permintaan yang lebih pendek; chunked prefill mengurangi masalah ini. Kuantisasi FP8 pada KV-cache hampir menggandakan kapasitas memori efektif dibandingkan FP16. Disarankan untuk memantau tren penggunaan cache dan puncak KV daripada menunggu OOM.
Sumber: Habr — хаб ИИ —
asli
