Sand.ai تفتح مصدر أول نموذج لتوليد الفيديو بمليارات المعاملات وبنية الخبراء المختلطة: 114 مليار معامل و 6 مليارات مفعلة
أصدرت Sand.ai نموذج MAGI-2-preview، وهو أول نموذج مفتوح المصدر لتوليد الفيديو بأكثر من 100 مليار معامل باستخدام بنية الخبراء المختلطة. يبلغ إجمالي معاملات النموذج 114 مليارًا، لكنه ينشط حوالي 6 مليارات فقط في كل تمرير أمامي، مما يتيح توليد فيديو بدقة 1080p لمدة 10 ثوانٍ بتكلفة 0.5 يوان فقط، أي حوالي عُشر تكلفة النماذج السائدة. يحتل النموذج المرتبة السادسة على معيار AA لتوليد الفيديو، مما يُظهر أداءً قويًا مع تفعيل ضئيل.
أعلن فريق Sand.ai، المرتبط بجامعة تسينغهوا (Tsinghua)، عن فتح المصدر الكامل لنموذج MAGI-2-preview، وهو أول نموذج مفتوح المصدر لتوليد الفيديو يضم مئة مليار معامل (بارامتر) ويعتمد بنية خليط الخبراء (Mixture-of-Experts، MoE). يمتلك النموذج 114 مليار معامل إجمالاً، لكنه ينشّط فقط نحو 6 مليارات معامل في كل عملية استدلال، ما يقلّص التكاليف بشكل كبير. ووفقاً لأسعار بطاقات H100 الحالية باستخدام مجموعة من 8 بطاقات، فإن توليد فيديو بدقة 1080p ومدة 10 ثوانٍ لا يكلف سوى 0.5 يوان صيني، أي نحو عُشر تكلفة النماذج السائدة.
ويحتل MAGI-2-preview المرتبة السادسة في مؤشر أداء AA لتوليد الفيديو، محققاً أداءً قريباً من النماذج الرائدة رغم تفعيله لـ6 مليارات معامل فقط. يعتمد النموذج بنية دفق واحد (single-stream) حيث تُعالَج رموز النص والفيديو والصوت معاً ضمن محوّل (Transformer) موحّد، ما يتيح تزامناً أفضل بين الصورة والصوت.
كما يستخدم النموذج تقنية Multi-Head LatentMoE، التي تقسّم التمثيل الكامن المخفي ذا الأبعاد 3072 إلى 12 رأساً بأبعاد 256 لكل منها، مع توجيه (routing) مستقل لكل رأس، بحيث يمكن لكل رمز (token) تفعيل 72 خبيراً صغيراً عبر 36 طبقة، ليصل إجمالي عدد الخبراء إلى 3072 في كل طبقة. وطوّر فريق Sand.ai مكتبة نواة (kernel) مخصصة أُطلق عليها اسم MagiMoE، إلى جانب استراتيجية Head Parallel، لتحسين كفاءة الاتصال والحوسبة عند معالجة التسلسلات الطويلة، مع استخدام خوارزمية Muon لمعاملات المصفوفات وخوارزمية AdamW لمعاملات الخبراء.
أما استراتيجية البيانات، فتركّز على تنظيم بيانات متنوعة بدلاً من تصفيتها وانتقائها بشكل صارم، بينما ينقسم التدريب إلى مرحلة تدريب أولي (pre-training) لتحقيق تغطية واسعة، ومرحلة تدريب لاحق (post-training) لضبط النموذج وتحقيق التوافق والسلامة.
ويُحدث فتح مصدر هذا النموذج تحولاً في الصناعة، إذ يوفّر للباحثين نموذجاً علنياً يمكن دراسته، ويمنح الشركات خياراً للنشر الخاص (private deployment)، كما يعزز المنافسة بين النماذج المفتوحة والمغلقة المصدر.
وقد أسس Sand.ai الباحث Cao Yue، أحد مؤلفي نموذج Swin Transformer، ويواصل الفريق مساره غير التقليدي، إذ وصف Kai-Fu Lee هذا العمل بأنه 'نسخة DeepSeek في مجال توليد الفيديو بالذكاء الاصطناعي'.
المصدر: QbitAI 量子位 —
الأصلي
