KV कैश सर्वाइवल गाइड: आपका GPU स्थानीय LLMs के साथ मेमोरी क्यों खत्म करता है

MetaMeta
यह लेख बताता है कि स्थानीय LLMs चलाते समय GPU की मेमोरी क्यों खत्म हो जाती है, और इसका मुख्य कारण KV कैश है। यह मेमोरी उपयोग को प्रबंधित करने के लिए तकनीकों के साथ एक सर्वाइवल गाइड प्रदान करता है।
यह लेख बताता है कि स्थानीय बड़े भाषा मॉडल (एलएलएम) चलाने से जीपीयू की मेमोरी खत्म हो सकती है, जिसमें की-वैल्यू (KV) कैश एक प्रमुख योगदानकर्ता है। यह वर्णन करता है कि KV कैश मध्यवर्ती ध्यान मानों को संग्रहीत करता है, जो अनुक्रम लंबाई और बैच आकार के साथ रैखिक रूप से बढ़ता है, जिससे महत्वपूर्ण मेमोरी की खपत होती है। यह मार्गदर्शिका क्वांटाइज़ेशन, फ्लैश अटेंशन का उपयोग, छोटे मॉडल चुनने या सीपीयू ऑफलोडिंग जैसी रणनीतियाँ प्रदान करती है। यह मेमोरी बचत और गति या गुणवत्ता के बीच व्यापार-बंद (ट्रेड-ऑफ) पर जोर देती है।
स्रोत: Meta AI (GNews) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार