Ming-Flash-Omni: التقنيات الرئيسية والممارسات لنموذج موحد شامل الوسائط
في مؤتمر QCon بكين 2026، شرح الخبير الخوارزمي الأول في مجموعة Ant Group، Guo Qingpei، تطوير Ming-Flash-Omni، وهو نموذج موحد شامل الوسائط بمعلمات تريليونية. غطت المحاضرة البنية الموحدة مع التوجيه المتعدد وأنظمة AnyExperts، واستراتيجية التدريب التعاوني، وتحسينات الهندسة، مما حقق نتائج متقدمة على جميع الوسائط.
قدّم قوه تشينغبي (Guo Qingpei) من Ant Group البنية التقنية والممارسات الكامنة خلف نموذج Ming-Flash-Omni، وهو نموذج موحّد كامل الوسائط يضم مئات المليارات من المعاملات (Parameters)، خلال مؤتمر QCon Global Software Development Conference 2026 Beijing. يوحّد هذا النموذج فهم الصوت والفيديو والصورة والنص مع مهام التوليد ضمن إطار عمل واحد.
لمعالجة مسألة توحيد الوسائط، صمّم الفريق آلية موجِّهات متعددة (multi-router) للتعامل مع توجيه الخبراء الخاص بكل وسيط، إضافةً إلى آلية AnyExperts التي توزّع الخبراء ديناميكيًا بحسب أهمية الرمز (Token)، مما يقلّل التكرار الزائد في رموز الصور والفيديو. كما استحدث الفريق استراتيجية تدريب تعاونية تعتمد على تخطيط نسب البيانات وتعديل معدل التعلّم ديناميكيًا بحسب سرعة التقارب.
أما بالنسبة لتوحيد المهام، فقد بنى الفريق على أساس نواة فهم متعددة الوسائط مجمَّدة (Frozen)، أضاف إليها قدرات توليد الصور وتوليف الكلام، واستكملها بمعرفة بصرية دقيقة عبر تدريب على التجزيء التوليدي (Generative Segmentation)، ونهج مزدوج التدفق للمعلومات للحفاظ على الهوية، وباستخراج منفصل للسمات المطبعية لتجنّب ظهور نص مشوّه. وتم تعزيز توليد الكلام بميزات التحكم باللهجة والعاطفة ونغمة الصوت المخصّصة، مع توليد متزامن للكلام والصوت والموسيقى.
حقّق النموذج نتائج متقدّمة عبر مختلف الوسائط، مضاهيًا أو متفوّقًا على النماذج المتخصصة، ويُعدّ أول نموذج مفتوح المصدر موحّد كامل الوسائط بحجم تريليون معامل. وشملت التحسينات الهندسية مخططًا لتجميع التسلسلات كامل الوسائط واستراتيجيات موازاة مرنة، ما رفع كفاءة التدريب بنسبة 67%.
كما استكشف الفريق التوحيد على مستوى التمثيل من خلال مشروعين مفتوحي المصدر هما MingTok وMingTok-Audio، اللذين يُظهران إطار عمل موحّدًا لفهم وتوليد الصور والصوت على حدٍّ سواء.
المصدر: InfoQ 中国 —
الأصلي
