الأبحاث 🇺🇸 28.07.2026 15:06

ذاكرة التخزين المؤقت للمفاتيح والقيم في النماذج اللغوية الكبيرة: الفهم والتنفيذ من الصفر

ذاكرة التخزين المؤقت للمفاتيح والقيم هي تقنية للاستدلال الفعّال في النماذج اللغوية الكبيرة، حيث تخزّن المتجهات الوسيطة للمفاتيح والقيم لإعادة استخدامها، مما يتجنب العمليات الحسابية المتكررة. تشرح المقالة هذا المفهوم وتوفر تنفيذًا برمجيًا من الصفر باستخدام PyTorch، مع توضيح كيفية تعديل آلية الانتباه متعدد الرؤوس لتخزين المفاتيح والقيم مؤقتًا أثناء توليد النص.
تقوم ذاكرة التخزين المؤقت KV بتخزين متجهات المفتاح (K) والقيمة (V) من حسابات الانتباه السابقة لإعادة استخدامها عند توليد الرموز اللاحقة، مما يسرع الاستدلال من خلال تجنب إعادة الحساب. بدون ذاكرة التخزين المؤقت KV، تقوم كل خطوة توليد بإعادة حساب المفاتيح والقيم لجميع الرموز السابقة؛ مع وجود ذاكرة التخزين المؤقت، يتم حساب متجهات الرمز الجديد فقط وإلحاقها بذاكرة التخزين المؤقت. تقدم المقالة تنفيذًا للكود يعتمد على نموذج شبيه بـ GPT من كتاب المؤلف. التغييرات الرئيسية هي: إضافة مخازن مؤقتة (cache_k و cache_v) في فئة MultiHeadAttention، تعديل طريقة forward لاستخدام ذاكرة التخزين المؤقت بشكل مشروط، إضافة طريقة إعادة تعيين، ونشر علامة use_cache عبر النموذج. في عملية التوليد، عندما يكون use_cache صحيحًا، يعالج النموذج الرمز الجديد فقط بعد المطالبة الأولية، بينما بدون ذاكرة تخزين مؤقت يعالج التسلسل الكامل في كل خطوة. تُظهر مقارنة أداء بسيطة أن ذاكرة التخزين المؤقت KV تضاعف تقريبًا سرعة التوليد للمثال المُختبَر.
المصدر: Sebastian Raschka — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة