AMD تُطلق Instella-MoE-16B-A3B: نموذج لغوي مفتوح بالكامل من نوع Mixture-of-Experts بعدد 16 مليار معلمة نشطة 2.8 مليار تم تدريبه على رقائق Instinct
قدمت AMD نموذج Instella-MoE-16B-A3B، وهو نموذج لغوي مفتوح بالكامل من نوع Mixture-of-Experts بإجمالي 16 مليار معلمة و2.8 مليار معلمة نشطة لكل رمز، تم تدريبه من الصفر على رقائق Instinct MI300X وMI325X. يشمل الإصدار الأوزان ومخاليط البيانات وإعدادات التدريب وكود الاستدلال، مع ميزات مبتكرة مثل الانتباه متعدد الرؤوس الكامن الموجه واتصال FarSkip-Collective.
أصدرت AMD نموذج Instella-MoE-16B-A3B، وهو نموذج لغة مفتوح بالكامل يعتمد على تقنية خليط الخبراء، تم تدريبه من الصفر على وحدات معالجة الرسوميات Instinct MI300X وMI325X. يمتلك النموذج 16 مليار معامل إجمالي لكنه يُفعّل فقط 2.8 مليار معامل لكل رمز، باستخدام خبيرين مشتركين و6 خبراء موجَّهين يتم اختيارهم من 64 خبيرًا في كل طبقة من طبقات خليط الخبراء. تنشر AMD أوزان النموذج من كل مرحلة تدريب، بالإضافة إلى خلائط البيانات وإعدادات التدريب وكود الاستدلال. هناك خياران هيكليان رئيسيان: الانتباه متعدد الرؤوس الكامن المبوَّب (Gated Multi-head Latent Attention)، الذي يضيف بوابة تعلم خفيفة الوزن على المخرجات، و FarSkip-Collective، الذي يداخل اتصالات توازي الخبراء مع العمليات الحسابية. تذكر AMD تحقيق تسريع بنسبة 12.7% في مرحلة ما قبل التدريب، وانخفاض يصل إلى 39.2% في زمن أول رمز عند الخدمة باستخدام توازي الخبراء. تم تدريب النموذج مسبقًا على 7.1 تريليون رمز من مجموعات بيانات مفتوحة، مع مرحلة تدريب متوسطة باستخدام Dolma3 Dolmino 100B، ومرحلة سياق طويل تمدد النافذة من 4 آلاف إلى 64 ألف رمز باستخدام تقنية YaRN. يتضمن ما بعد التدريب الضبط الدقيق المُوجَّه (SFT)، والتحسين التفضيلي المباشر (DPO)، والتعلم المعزز في إطار Miles. يبلغ متوسط أداء النموذج الأساسي 76.7، وهو الأعلى بين النماذج المفتوحة بالكامل، متقدمًا على Moonlight-16B-A3B (76.2) وغيره. الأوزان متاحة بموجب ترخيص ResearchRAIL للأغراض الأكاديمية والبحثية فقط، بينما كود التدريب مرخص بموجب رخصة MIT.
المصدر: MarkTechPost —
الأصلي
