Ray Serve

En son yapay zeka haberleri, modeller ve sürümler Ray Serve.

Üretimde LLM Çıkarımında Performans Düşüşü: KV önbelleği, OOM ve p99 Kuyruk Gecikmesi

Üretimdeki LLM çıkarımı genellikle KV önbelleği parçalanması, uzun bağlamlarda bellek yetersizliği (OOM), kuyruk başı engelleme ve p99 gecikme artışları nedeniyle kademeli olarak bozulur. VK Cloud elçisi Stas Pogorzhelsky, performans düşüşüne neden olan dört mekanizmayı açıklıyor ve olaylardan önce sorunları yakalamak için yeniden üretim betikleri ve metrikler sunuyor.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Güncel haberler