प्रोडक्शन में LLM इन्फरेंस डिग्रेडेशन: KV-कैश, OOM, और p99 टेल
प्रोडक्शन में LLM इन्फरेंस अक्सर धीरे-धीरे खराब होता है, जो KV-कैश फ्रैग्मेंटेशन, लंबे संदर्भों में OOM, हेड-ऑफ-लाइन ब्लॉकिंग, और p99 लेटेंसी स्पाइक्स के कारण होता है। VK क्लाउड के इवेंजेलिस्ट Stas Pogorzhelsky चार ऐसे तंत्रों की व्याख्या करते हैं जो प्रदर्शन में गिरावट लाते हैं, और समस्याओं को घटित होने से पहले पकड़ने के लिए रिप्रोडक्शन स्क्रिप्ट्स और मेट्रिक्स प्रदान करते हैं।
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
