دليل بصري لأنواع الانتباه في نماذج اللغة الكبيرة الحديثة
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
تقدم هذه المقالة نظرة عامة مرئية لآليات الانتباه في نماذج اللغة الكبيرة الحديثة، بدءًا من الانتباه متعدد الرؤوس القياسي (MHA) وصولاً إلى انتباه الاستعلام المجمّع (GQA)، والانتباه الكامن متعدد الرؤوس (MLA)، والانتباه المتناثر، والهياكل الهجينة. وهي مصحوبة بمعرض لهياكل نماذج اللغة الكبيرة يضم 45 إدخالاً ونسخًا ملصقة.
نشر سيباستيان راشكا دليلاً مرئياً لتنويعات الانتباه في نماذج اللغة الكبيرة الحديثة، إلى جانب معرض يضم 45 بنية لنماذج اللغة الكبيرة. يغطي المقال الانتباه متعدد الرؤوس (Multi-Head Attention - MHA)، وسياقه التاريخي، بالإضافة إلى الانتباه الاستعلامي المجمع (Grouped-Query Attention - GQA) الذي يخفض تكاليف ذاكرة التخزين المؤقت للقيمة المفتاحية (KV-cache) من خلال مشاركة رؤوس القيمة المفتاحية. يعتبر GQA حلاً وسطاً شائعاً بين الكفاءة والجودة. كما يناقش المقال الانتباه الكامن متعدد الرؤوس (Multi-Head Latent Attention - MLA)، المستخدم في DeepSeek V3، والذي يضغط ذاكرة التخزين المؤقت بشكل أكثر فعالية مع الحفاظ على أداء أفضل. بالإضافة إلى ذلك، يتناول المقال الانتباه المتفرق (Sparse Attention) والبنى الهجينة، ويشمل نماذج أمثلة لكل تنويع. تتوفر نسخة ملصقة عبر Redbubble.
المصدر: Sebastian Raschka —
الأصلي
