Üretimde LLM Çıkarımında Performans Düşüşü: KV önbelleği, OOM ve p99 Kuyruk Gecikmesi
Üretimdeki LLM çıkarımı genellikle KV önbelleği parçalanması, uzun bağlamlarda bellek yetersizliği (OOM), kuyruk başı engelleme ve p99 gecikme artışları nedeniyle kademeli olarak bozulur. VK Cloud elçisi Stas Pogorzhelsky, performans düşüşüne neden olan dört mekanizmayı açıklıyor ve olaylardan önce sorunları yakalamak için yeniden üretim betikleri ve metrikler sunuyor.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
