Üretimde LLM Çıkarımında Performans Düşüşü: KV önbelleği, OOM ve p99 Kuyruk Gecikmesi
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Üretimdeki LLM çıkarımı genellikle KV önbelleği parçalanması, uzun bağlamlarda bellek yetersizliği (OOM), kuyruk başı engelleme ve p99 gecikme artışları nedeniyle kademeli olarak bozulur. VK Cloud elçisi Stas Pogorzhelsky, performans düşüşüne neden olan dört mekanizmayı açıklıyor ve olaylardan önce sorunları yakalamak için yeniden üretim betikleri ve metrikler sunuyor.
VK Cloud teknoloji evangelisti Stas Pogorzhelsky, üretimdeki LLM çıkarımının genellikle aniden değil, kademeli olarak bozulduğunu açıklıyor. Dört temel mekanizmayı tanımlıyor: %60-80 bellek kaybına neden olan KV-önbellek parçalanması, uzun bağlamlarda OOM, toplu işlemlerde başta bekleyen engelleme (head-of-line blocking) ve p50/p99 metrik sapması. Makale, sorunları olaylardan önce yakalamak için yeniden üretim scriptleri ve metrikler sağlıyor. Üretimde KV-önbelleğinin genellikle model ağırlıklarını aştığını vurguluyor. PagedAttention, parçalanmayı %4'ün altına indirir ve verimi 2-4 kat artırır, ancak dış parçalanma ve tahliye (eviction) zamanla sorunlara neden olmaya devam eder. Sürekli toplu işleme (continuous batching), uzun bir ön doldurma (prefill) isteğinin daha kısa olanları geciktirmesiyle başta bekleyen engellemeye neden olabilir; parçalı ön doldurma (chunked prefill) bu durumu hafifletir. KV-önbelleğinin FP8 nicelemesi, FP16'ya kıyasla etkin bellek kapasitesini neredeyse iki katına çıkarır. OOM beklemek yerine önbellek kullanımı ve tepe KV eğilimlerinin izlenmesi önerilir.
Kaynak: Habr — хаб ИИ —
orijinal
