Amazon SageMaker HyperPod पर Curvine के साथ बड़े LLM के लिए टियरित KV कैश

Amazon Web ServicesAmazon Web Services MetaMeta DeepSeekDeepSeek vLLMvLLM
यह पोस्ट Amazon SageMaker HyperPod पर एक टियरित KV कैश आर्किटेक्चर का वर्णन करता है, जो Curvine, एक वितरित कैश फाइलसिस्टम का उपयोग करके कैश पदानुक्रम को GPU से CPU तक और साझा NVMe पूल तक बढ़ाता है। यह क्रॉस-रेप्लिका KV कैश पुन: उपयोग को सक्षम बनाता है, जिससे अधिकतम 100% क्रॉस-पॉड कैश हिट दर और 2.7 गुना तक TTFT में सुधार प्राप्त होता है। यह समाधान कार्यभार को कम लागत वाले G6e इंस्टेंस पर चलाने की अनुमति देकर बुनियादी ढांचे की लागत को कम करता है, बजाय P5 के।
बड़े पैमाने पर लार्ज लैंग्वेज मॉडल (एलएलएम) इन्फ्रेंस चलाने में आम तौर पर केवी कैश ट्रेड-ऑफ की मजबूरी होती है: या तो बढ़ते केवी कैश को समायोजित करने के लिए अत्यधिक बड़े जीपीयू इंस्टेंस के लिए भुगतान करना, या धीमी टाइम-टू-फर्स्ट-टोकन (टीटीएफटी) को स्वीकार करना क्योंकि समान प्रॉम्प्ट हर अनुरोध पर फिर से कंप्यूट किए जाते हैं। क्यूवेन, लामा, डीपसीक और अन्य जैसे सार्वजनिक रूप से उपलब्ध फाउंडेशन मॉडल (एफएम) की एक विस्तृत सूची को प्रति-बिजनेस-लाइन एंडपॉइंट, रिट्रीवल ऑगमेंटेड जनरेशन (आरएजी) पाइपलाइन, या मल्टी-टर्न डायलॉग अनुप्रयोगों में तैनात करने वाली टीमों के लिए, यह ट्रेड-ऑफ सीधे उच्च बुनियादी ढांचे की लागत और खराब उपयोगकर्ता अनुभव में तब्दील हो जाता है। मूल कारण यह है कि जनरेशन के दौरान, वीएलएलएम प्रत्येक टोकन के लिए अटेंशन की और वैल्यू को केवी कैश में संग्रहीत करता है, और प्रीफिक्स कैशिंग साझा शुरुआती टोकन वाले अनुरोधों में उस कैश का पुन: उपयोग करती है। एमएल.जी6ई.4एक्सलार्ज (48 जीबी प्रति जीपीयू) जैसे लागत-कुशल इंस्टेंस पर, प्रीफिक्स कैशिंग के लिए छोड़ी गई मेमोरी सीमित होती है, और लंबे प्रॉम्प्ट पर कैश हिट दर गिर जाती है, समान सिस्टम प्रॉम्प्ट हर अनुरोध पर फिर से प्री-फिल होते हैं, और क्षैतिज रूप से स्केल किए गए वीएलएलएम रेप्लिका में से प्रत्येक अलग-अलग कैश बनाए रखता है। समाधान तीन-स्तरीय कैश पदानुक्रम बनाता है: एल0 (जीपीयू प्रीफिक्स कैश), एल1 (सीपीयू मेमोरी ऑफलोड), और एल2 (कर्वाइन के माध्यम से साझा वितरित एनवीएमई पूल)। एल0 वीएलएलएम की मूल पेज-अटेंशन परत है, एल1 एलएमकैश का उपयोग करके बेदखल किए गए जीपीयू ब्लॉकों को होस्ट डीआरएएम में ऑफलोड करता है, और एल2 कर्वाइन के माध्यम से स्थानीय एनवीएमई ड्राइव को एक साझा नेमस्पेस में पूल करता है, जिसे हर इन्फ्रेंस पॉड में रीडराइटमेनी पीवीसी के रूप में माउंट किया जाता है। हाइपरपॉड का इंटेलिजेंट रूटिंग अनुरोधों को उन रेप्लिका तक निर्देशित करता है जिनके पास प्रासंगिक केवी ब्लॉक होने की सबसे अधिक संभावना होती है, जिसमें प्रीफिक्स-अवेयर, केवी-अवेयर और राउंड-रॉबिन जैसी रणनीतियाँ शामिल हैं। शुद्ध प्रभाव: केवल पूर्ण मिस होने पर सिस्टम खरोंच से फिर से प्री-फिल करता है, जिससे मध्यम से उच्च प्रॉम्प्ट ओवरलैप वाले कार्यभार के लिए टीटीएफटी काफी कम हो जाता है। एक परीक्षण तैनाती में, इसने 100% तक क्रॉस-पॉड कैश हिट दर, 2.7 गुना तक टीटीएफटी सुधार, और लगभग 1,900-टोकन प्रॉम्प्ट के लिए लगभग 56 एमएस की क्रॉस-नोड एल2 रीड लेटेंसी हासिल की। इस आर्किटेक्चर के साथ, जिन कार्यभारों के लिए पहले पी5 इंस्टेंस की आवश्यकता होती थी, वे कम लागत वाले जी6ई इंस्टेंस पर चल सकते हैं, जिससे प्रति-एंडपॉइंट लागत कम हो जाती है। कार्यान्वयन के लिए टियरड स्टोरेज सक्षम के साथ सेजमेकर हाइपरपॉड, एक ईकेएस क्लस्टर और इन्फ्रेंस ऑपरेटर और कर्वाइन की स्थापना की आवश्यकता होती है। पोस्ट पांच चरणों के माध्यम से चलती है: टियरड स्टोरेज को सक्षम करना, इन्फ्रेंस ऑपरेटर और निर्भरताओं को स्थापित करना, कर्वाइन को स्थापित करना, फाइलसिस्टम-बैक्ड एल2 के लिए इन्फ्रेंस ऑपरेटर को पैच करना, और बेंचमार्किंग।
स्रोत: AWS ML blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार