كتابة محول فك تشفير فقط لنموذج لغة كبير من الصفر في بايثون
Google/DeepMind
OpenAI
Meta
يصف مؤلف سلسلة من المقالات بالتفصيل تنفيذ كتلة محول لنموذج لغة كبير صغير يعمل فقط كفك تشفير باستخدام إطار عمل باي تورش. تشمل المكونات: الانتباه متعدد الرؤوس مع الإخفاء، الشبكة العصبية المغذية الأمامية مع GELU، طبقة التطبيع، والوصلات المتبقية. تشرح المقالة الاختلاف عن البنية الأصلية: استخدام التطبيع المسبق (Pre-LN) بدلاً من التطبيع اللاحق لتحقيق استقرار التدريب.
في هذا المقال، يشرح فلاديمير كيفية بناء كتلة محول (Transformer block) لنموذج لغة يعمل بوحدة فك الترميز فقط (decoder-only LLM)، باستخدام مثال مهمة وضع علامة مائية على النص المرخص. ويوضح أن المحول هو بنية من ورقة Google البحثية "الانتباه هو كل ما تحتاجه" (Attention Is All You Need)، حيث تتم معالجة التسلسل بشكل متوازٍ باستخدام آلية الانتباه. يعتمد الانتباه متعدد الرؤوس (Multi-Head Attention) على ثلاث مصفوفات إسقاط: Q وK وV. في المرحلة الأولى، يُحسب التشابه بين الرموز (مصفوفة الانتباه)، وفي المرحلة الثانية، يتم خلط محتوى الرموز وفقًا للأوزان الناتجة. لتحقيق الكفاءة، يتم تنفيذ جميع رؤوس الانتباه من خلال إسقاط خطي كبير واحد. بعد الانتباه، تُطبق شبكة التغذية الأمامية (Feed Forward Network) مع تفعيل GELU و dropout. يشمل بناء المحول التطبيع (Pre-LN) والوصلات المتبقية. كما تُضاف قناع المستقبل (causal mask) لوحدة فك الترميز. بشكل عام، الكتلة جاهزة للاستخدام في بناء نموذج لغة كبير (Large Language Model - LLM)، وتدريبه، وتوليد النص.
المصدر: Habr — хаб NLP —
الأصلي
