أهم أسئلة مقابلات معالجة اللغة الطبيعية: بنى نماذج اللغات الكبيرة والاستدلال وتحسين الأداء

MistralMistral Google/DeepMindGoogle/DeepMind
تقدم هذه المقالة قائمة مرجعية بالمواضيع والأسئلة الأساسية للمقابلات التقنية حول بنى نماذج اللغات الكبيرة الحديثة وتحسين الاستدلال. وتغطي الاختلافات المعمارية عن محول فانيلا (Pre-Norm, RMSNorm, SwiGLU, RoPE, GQA/MQA, MoE)، وتشرح لماذا يكون استدلال نماذج اللغات الكبيرة مكلفًا، وتصف التجميع (batching)، وذاكرة التخزين المؤقت KV (KV-cache)، والتكميم (quantization)، وتقنيات تسريع أخرى.
تتكون نماذج اللغات الكبيرة التوليدية الحديثة في الغالب من محولات تعتمد على فك التشفير فقط، وتختلف عائلات مثل GPT وLLaMA وMistral وQwen وGemma في الانفتاح، وعدد المعلمات (من مئات الملايين إلى مئات المليارات)، وتفاصيل البنية (كثيفة مقابل خليط من الخبراء)، ونوع الانتباه، والتطبيع، والتشفير الموضعي، وخصائص شبكة التغذية الأمامية، وطول نافذة السياق (مثل 4k، 32k، 128k رمزًا)، والدعم متعدد الوسائط، والتدريب، والترخيص. بالمقارنة مع المحول الكلاسيكي، تستخدم نماذج اللغات الكبيرة الحديثة التطبيع المسبق بدلاً من التطبيع اللاحق (تدريب أكثر استقرارًا)، وRMSNorm بدلاً من LayerNorm (أرخص)، وFFN ببوابات SwiGLU (أكثر تعبيرًا ولكنها تضيف طبقة خطية ثالثة)، وتضمينات موضعية RoPE، وMQA/GQA بدلاً من الانتباه متعدد الرؤوس الكامل، وأحيانًا خليط من الخبراء (MoE) للحساب الشرطي، وسياق أطول، وتحسينات الاستدلال. الاستدلال مكلف لأن التوليد الذاتي الانحداري يقرأ جميع الأوزان لكل رمز، وتنمو ذاكرة التخزين المؤقت للقيم الرئيسية مع السياق والدفعة، وهناك مرحلتان: التعبئة المسبقة (مقيدة بالحساب) وفك التشفير (مقيد بالذاكرة). تعد المفاضلات بين زمن الاستجابة (الوقت حتى الرمز الأول، وزمن الاستجابة بين الرموز) والإنتاجية أمرًا أساسيًا؛ وتشمل تقنيات التحسين ذاكرة التخزين المؤقت للقيم الرئيسية، والانتباه المقسم إلى صفحات، والتجميع المستمر، وفك التشفير التخميني، والكمية، والتقطير.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة