प्रोडक्शन में LLM इन्फरेंस डिग्रेडेशन: KV-कैश, OOM, और p99 टेल

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
प्रोडक्शन में LLM इन्फरेंस अक्सर धीरे-धीरे खराब होता है, जो KV-कैश फ्रैग्मेंटेशन, लंबे संदर्भों में OOM, हेड-ऑफ-लाइन ब्लॉकिंग, और p99 लेटेंसी स्पाइक्स के कारण होता है। VK क्लाउड के इवेंजेलिस्ट Stas Pogorzhelsky चार ऐसे तंत्रों की व्याख्या करते हैं जो प्रदर्शन में गिरावट लाते हैं, और समस्याओं को घटित होने से पहले पकड़ने के लिए रिप्रोडक्शन स्क्रिप्ट्स और मेट्रिक्स प्रदान करते हैं।
वीके क्लाउड के टेक्नोलॉजी इवेंजेलिस्ट स्टास पोगोज़ेल्स्की बताते हैं कि प्रोडक्शन एलएलएम इंफेरेंस में आमतौर पर अचानक विफलता के बजाय धीरे-धीरे गिरावट आती है। वे चार प्रमुख तंत्रों की पहचान करते हैं: केवी-कैश विखंडन जिससे 60-80% मेमोरी का नुकसान होता है, लंबे संदर्भों पर ओओएम (मेमोरी खत्म होना), बैचों में हेड-ऑफ-लाइन ब्लॉकिंग, और पी50/पी99 मेट्रिक्स का विचलन। लेख इन समस्याओं को घटित होने से पहले पकड़ने के लिए प्रजनन स्क्रिप्ट और मेट्रिक्स प्रदान करता है। यह उजागर करता है कि प्रोडक्शन में केवी-कैश अक्सर मॉडल वेट्स से अधिक होता है। पेज्ड-अटेंशन विखंडन को 4% से कम कर देता है और थ्रूपुट 2-4 गुना बढ़ा देता है, लेकिन बाहरी विखंडन और निष्कासन अभी भी समय के साथ समस्याएँ उत्पन्न करते हैं। निरंतर बैचिंग हेड-ऑफ-लाइन ब्लॉकिंग का कारण बन सकती है जब एक लंबा प्रीफिल अनुरोध छोटे अनुरोधों में देरी करता है; चंक्ड प्रीफिल इस समस्या को कम करता है। केवी-कैश का एफपी8 क्वांटाइजेशन एफपी16 की तुलना में प्रभावी मेमोरी क्षमता को लगभग दोगुना कर देता है। ओओएम की प्रतीक्षा करने के बजाय कैश उपयोग और पीक केवी के रुझानों की निगरानी करने की सलाह दी जाती है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार