دليل البقاء مع ذاكرة التخزين المؤقت KV: لماذا تنفد ذاكرة GPU عند استخدام نماذج اللغة المحلية

MetaMeta
تشرح المقالة لماذا تنفد ذاكرة GPU عند تشغيل نماذج اللغة المحلية، مع التركيز على ذاكرة التخزين المؤقت KV باعتبارها السبب. كما تقدم دليلًا للبقاء مع تقنيات لإدارة استخدام الذاكرة.
تشرح المقالة أن تشغيل نماذج اللغة الكبيرة محليًا يمكن أن يؤدي إلى نفاد ذاكرة وحدات معالجة الرسومات (GPUs)، حيث يُعدّ cache المفاتيح والقيم (KV cache) مساهمًا رئيسيًا في ذلك. تصف المقالة كيف يخزّن cache المفاتيح والقيم قيم الانتباه الوسيطة، والتي تنمو خطيًا مع طول التسلسل وحجم الدفعة، مما يستهلك قدرًا كبيرًا من الذاكرة. يقدم الدليل استراتيجيات مثل التكميم، واستخدام الانتباه الوامض (flash attention)، والتحول إلى نماذج أصغر أو استخدام تحميل المعالجة على وحدة المعالجة المركزية (CPU offloading). ويؤكد على المفاضلات بين توفير الذاكرة والسرعة أو الجودة.
المصدر: Meta AI (GNews) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة