MiniMax H3: الشبكة العصبية التي تخرج الأصوات وتحرر نفسها
أصدرت MiniMax نموذج H3 (المعروف أيضًا باسم Hailuo 3.0)، وهو نموذج ذكاء اصطناعي متعدد الوسائط يولد فيديو مع صوت متزامن، ويقوم بتحريرات تتبع الفيديوهات المرجعية، وحتى التعامل مع إزالة الخلفية الخضراء. النموذج مفتوح المصدر بموجب ترخيص، مع توفر الأوزان على Hugging Face، ويدعم دقة تصل إلى 2K عبر واجهة برمجة التطبيقات. يهدف إلى توحيد معالجة النصوص والصور والفيديو والصوت في سياق واحد.
أعلنت MiniMax عن إصدار H3، الذي يُعرف أيضًا باسم Hailuo 3.0 أو Hailuo 03، وهو نموذج متعدد الوسائط قادر على توليد مقاطع فيديو تتراوح مدتها بين 4 و15 ثانية بمعدل 24 إطارًا في الثانية مع صوت ستيريو أصلي بتردد 32 كيلو هرتز، ودقة تصل إلى 2K عبر واجهة برمجة التطبيقات أو 768p عند الاستضافة الذاتية. يمكن للنموذج معالجة ما يصل إلى 9 صور مرجعية و3 مقاطع فيديو و3 ملفات صوتية في وقت واحد، كما يمكنه تحرير مقاطع الفيديو لتتناسب مع توقيت وأسلوب مقطع مرجعي. كما أنه يزيل الشاشات الخضراء ويضبط الإضاءة. تعتمد البنية على ضغط المصادر في أوصاف لغوية (تقليل حوالي 100 ألف رمز إلى 4 آلاف)، واستخدام مُرمِّز VAE مُعاد تصميمه مع زيادة أربعة أضعاف في طول التسلسل الفعّال، ويتضمن حسابًا منفصلاً للفهم والتوليد. أصدرت MiniMax أوزان النموذج على Hugging Face في الفترة من 2 إلى 3 أغسطس 2026، بعد عدة أيام من إطلاق واجهة برمجة التطبيقات في 31 يوليو 2026. تُظهر العروض التوضيحية قدرة النموذج على التعامل مع مطالبات معقدة للتحرير والإعلانات والانتقالات السلسة، لكنه لا يزال يواجه صعوبة في التعامل مع النصوص الصغيرة داخل الفيديو، وهو ضعف شائع في نماذج توليد الفيديو.
المصدر: Habr — хаб ИИ —
الأصلي
