MiniMax تطلق MiniMax H3: نموذج فيديو متعدد الوسائط يولّد مقاطع 2K لمدة 15 ثانية مع صوت استريو أصلي
MiniMax
Google/DeepMind
ByteDance
أعلنت MiniMax عن MiniMax H3، وهو نموذج توليد متعدد الوسائط للأغراض العامة يوحّد معالجة النصوص والصور والفيديو والصوت، ويُخرج فيديو بدقة 2K مع صوت استريو أصلي. يتوفر النموذج عبر واجهة برمجة التطبيقات (API) وفي تطبيق Hailuo AI، مع وعد بإتاحة أوزانه قريبًا. وبسعر تنافسي، يتصدر H3 في تحرير الفيديو لكنه يتخلف عن منافسيه في معايير أخرى.
أعلنت شركة MiniMax عن إطلاق نموذج MiniMax H3، وهو نموذج متعدد الوسائط متعدد الأغراض للجيل، يقرأ النصوص والصور والفيديو والصوت كسياق موحد ويُرجع فيديو مع صوت ستيريو أصلي، ويدعم دقة 2K، ومدة تتراوح من 4 إلى 15 ثانية (أعداد صحيحة فقط). على عكس الحلول السابقة التي تتطلب نماذج منفصلة للنص إلى فيديو والصورة إلى فيديو ومهام أخرى، يدمج H3 هذه المهام في نموذج تدريب مسبق واحد حيث يتم التعبير عن العلاقات باللغة الطبيعية، مثل الإشارة إلى حركة الكاميرا من فيديو أو مطابقة الأصوات مع الصوت. أُطلق النموذج في 31 يوليو 2026، وهو متاح عبر واجهة برمجة التطبيقات (API) بمعرف النموذج MiniMax-H3 وفي تطبيق Hailuo AI الاستهلاكي. وهو موجّه للإعلانات والعلامات التجارية والتجارة الإلكترونية وتصميم المنتجات وتصميم واجهة المستخدم/تجربة المستخدم والألعاب وما قبل الإنتاج السينمائي ووسائط كتالوجات التجزئة، مع تطبيقات تشمل إعلانات متنوعة وفيديوهات المنتجات وملصقات متحركة ونقل الحركة من فيديو إلى فيديو. تدعم واجهة برمجة التطبيقات ثلاثة أوضاع للإدخال - النص إلى فيديو، الصورة الأولى/الأخيرة إلى فيديو، والجيل المرجعي - مع حدود إدخال تشمل ما يصل إلى 9 صور مرجعية، و3 فيديوهات مرجعية (مدة كل منها 2-15 ثانية، وبإجمالي ≤15 ثانية)، و3 مقاطع صوتية مرجعية (يتطلب الصوت صورة/فيديو مصاحب). الحد الأقصى للإدخال المختلط هو 12 ملفًا؛ والمطالبات ≤7,000 حرفًا؛ وحجم الطلب ≤64 ميغابايت؛ وأحجام الملفات: فيديو ≤50 ميغابايت، صورة ≤30 ميغابايت، صوت ≤15 ميغابايت. تشمل التنسيقات فيديو H.264/H.265، وصور JPG/PNG/WEBP/HEIC/HEIF، وصوت WAV/MP3. أربعة مكونات تقنية تتيح أداءه: تمثيل سياقي شامل (وصف يُحدد العلاقات، يختصر حوالي 100 ألف رمز إلى حوالي 4 آلاف)، وH3-VAE (مُرمّز يمنح مكسبًا بمقدار 4 أضعاف في طول التسلسل الفعّال مما يتيح دقة 2K أصلية)، ومحول H3-Omni (يفصل مهام الفهم والتوليد، مما يرفع إنتاجية التدريب بحوالي 30%)، وإعادة التوليد داخل السياق (النموذج الأساسي يعيد توليد المخرجات منخفضة الدقة داخل السياق بدلاً من إضافة تحسين فائق للدقة). تشير التسعيرات المعلنة: عند دقة 2K، سعر الثانية أقل من ثلث النماذج الرئيسية؛ وعند دقة 768p، أقل من نصف سعر 720p السائد. تشير أدوات التتبع الخارجية إلى 0.13 دولارًا للثانية (حوالي 1.95 دولارًا لمقطع مدته 15 ثانية)، لكن صفحة الدفع حسب الاستخدام في MiniMax لا تزال تعرض فئات Hailuo 2.3. وفقًا لـ SCMP نقلاً عن Artificial Analysis، يتصدر H3 في تحرير الفيديو، ويتخلف عن Gemini Omni Flash من Google في النص إلى فيديو، ويأتي خلف Seedance 2.0 وGemini Omni Flash في الصورة إلى فيديو. يُوعَد بفتح الأوزان 'في الأيام المقبلة' لكنها لم تُطرح بعد.
المصدر: MarkTechPost —
الأصلي
