प्रोडक्शन में LLM इन्फरेंस डिग्रेडेशन: KV-कैश, OOM, और p99 टेल
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
प्रोडक्शन में LLM इन्फरेंस अक्सर धीरे-धीरे खराब होता है, जो KV-कैश फ्रैग्मेंटेशन, लंबे संदर्भों में OOM, हेड-ऑफ-लाइन ब्लॉकिंग, और p99 लेटेंसी स्पाइक्स के कारण होता है। VK क्लाउड के इवेंजेलिस्ट Stas Pogorzhelsky चार ऐसे तंत्रों की व्याख्या करते हैं जो प्रदर्शन में गिरावट लाते हैं, और समस्याओं को घटित होने से पहले पकड़ने के लिए रिप्रोडक्शन स्क्रिप्ट्स और मेट्रिक्स प्रदान करते हैं।
वीके क्लाउड के टेक्नोलॉजी इवेंजेलिस्ट स्टास पोगोज़ेल्स्की बताते हैं कि प्रोडक्शन एलएलएम इंफेरेंस में आमतौर पर अचानक विफलता के बजाय धीरे-धीरे गिरावट आती है। वे चार प्रमुख तंत्रों की पहचान करते हैं: केवी-कैश विखंडन जिससे 60-80% मेमोरी का नुकसान होता है, लंबे संदर्भों पर ओओएम (मेमोरी खत्म होना), बैचों में हेड-ऑफ-लाइन ब्लॉकिंग, और पी50/पी99 मेट्रिक्स का विचलन। लेख इन समस्याओं को घटित होने से पहले पकड़ने के लिए प्रजनन स्क्रिप्ट और मेट्रिक्स प्रदान करता है। यह उजागर करता है कि प्रोडक्शन में केवी-कैश अक्सर मॉडल वेट्स से अधिक होता है। पेज्ड-अटेंशन विखंडन को 4% से कम कर देता है और थ्रूपुट 2-4 गुना बढ़ा देता है, लेकिन बाहरी विखंडन और निष्कासन अभी भी समय के साथ समस्याएँ उत्पन्न करते हैं। निरंतर बैचिंग हेड-ऑफ-लाइन ब्लॉकिंग का कारण बन सकती है जब एक लंबा प्रीफिल अनुरोध छोटे अनुरोधों में देरी करता है; चंक्ड प्रीफिल इस समस्या को कम करता है। केवी-कैश का एफपी8 क्वांटाइजेशन एफपी16 की तुलना में प्रभावी मेमोरी क्षमता को लगभग दोगुना कर देता है। ओओएम की प्रतीक्षा करने के बजाय कैश उपयोग और पीक केवी के रुझानों की निगरानी करने की सलाह दी जाती है।
स्रोत: Habr — хаб ИИ —
मूल
