جعل تقطير المعرفة رخيصًا بما يكفي للتشغيل على نطاق واسع
Multiverse Computing
NVIDIA
Meta
تقدم ورقة بحثية جديدة من شركة Multiverse Computing أسلوب تقطير معرفة غير متصل بكفاءة، باستخدام سجلات أعلى قيمة مخزنة مؤقتًا ووظيفة خسارة تربيعية مجزأة مدمجة، مما يقلل استخدام الذاكرة العشوائية بأكثر من 15 مرة ويتيح تقطير السياقات الطويلة على معالج رسومات واحد. تعمل هذه التقنيات على خفض تكاليف التدريب بشكل كبير، مما يجعل تجارب التقطير واسعة النطاق عملية.
يُعدّ التقطير المعرفي (Knowledge Distillation)، حيث يتعلم نموذج "طالب" أصغر حجماً مضاهاةَ نموذج "معلّم" أكبر حجماً، تقنية معيارية لضغط نماذج اللغة الكبيرة (LLMs). ونظراً لأن نماذج اللغة الكبيرة مفتوحة المصدر الحديثة، مثل Kimi-K3 بـ 2.8 تريليون مُعامل (Parameter)، تتطلب نحو 3 تيرابايت من ذاكرة الوصول العشوائي للرسوميات (VRAM)، يصبح الضغط أمراً ضرورياً. تتناول الورقة البحثية بعنوان 'Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss' التكاليف الباهظة لعملية التقطير من خلال تخزين أعلى-K (Top-K) من القيم اللوغاريتمية (Logits) الخاصة بالمعلّم في ذاكرة تخزين مؤقت خارج الاتصال (Offline)، وهو ما يُلغي الحاجة إلى الاحتفاظ بالمعلّم في الذاكرة. كما تقدّم الورقة دالة خسارة مدمجة ومجزّأة قائمة على تباعد كولباك-لايبلر (KL Divergence)، تحتسب الخسارة على أجزاء متتالية، متجنبةً بذلك الحاجة إلى مصفوفة كاملة بحجم (المفردات × التسلسل). ويُقلّص هذا الأسلوب الحد الأقصى لاستهلاك ذاكرة VRAM من 250 جيجابايت إلى 128 جيجابايت على معالج رسوميات واحد من طراز H200، مما يجعل بالإمكان إجراء عملية التقطير عند سياق (Context) يبلغ 32 ألف رمز (Token) على معالج رسومي واحد بدلاً من أربع عُقد حاسوبية، مع تسريع زمن كل خطوة بمعدل خمس مرات. أما نموذج الطالب، المُقطَّر من Llama 3.1 8B Instruct إلى 3.2 مليار مُعامل، فقد حافظ على معظم دقته في اختبارات القياس المرجعي مثل BoolQ وHellaSwag، وبقي الفرق ضمن تسع نقاط في اختبار MMLU.
المصدر: Hugging Face blog —
الأصلي
