मॉडलओपन सोर्स 🇩🇪 03.08.2026 17:02

MiniMax H3 पहला ओपन वीडियो मॉडल बनकर वीडियो एडिटिंग रैंकिंग में शीर्ष पर पहुंचा

MiniMaxMiniMax ByteDanceByteDance
MiniMax ने अपने वीडियो मॉडल H3 के वेट्स जारी किए हैं, जिससे यह पहला ओपन मॉडल बन गया है जो वीडियो रैंकिंग में शीर्ष स्थान पर पहुंचा है। Artificial Analysis के अनुसार, H3 वीडियो एडिटिंग में पहले, टेक्स्ट-टू-वीडियो में दूसरे, और इमेज-टू-वीडियो में तीसरे स्थान पर है। 33 अरब पैरामीटर वाला यह मॉडल टेक्स्ट, इमेज, वीडियो और ऑडियो को एक साथ प्रोसेस करता है, स्टीरियो साउंड के साथ क्लिप बनाता है, लेकिन कुछ घटक अभी भी बंद हैं।
मिनीमैक्स ने अपने वीडियो मॉडल H3 के वेट्स को सार्वजनिक रूप से उपलब्ध करा दिया है, जो वीडियो रैंकिंग में शीर्ष पर पहुंचने वाला पहला ओपन मॉडल है। आर्टिफिशियल एनालिसिस पर, H3 वीडियो एडिटिंग में पहले, टेक्स्ट-टू-वीडियो में दूसरे और इमेज-टू-वीडियो में तीसरे स्थान पर है। 33 अरब पैरामीटर वाला मॉडल टेक्स्ट, इमेज, वीडियो और ऑडियो को एक साथ प्रोसेस करता है, और स्टीरियो साउंड के साथ चार से पंद्रह सेकंड का क्लिप तैयार करता है। मॉडल कार्ड के अनुसार, यह प्रति प्रॉम्प्ट नौ संदर्भ इमेज, तीन वीडियो क्लिप और तीन ऑडियो क्लिप तक संभाल सकता है। हालाँकि, दो घटक बंद हैं: 2K रिज़ॉल्यूशन के लिए मॉड्यूल और H3-Context-IR, जो प्रॉम्प्ट और संदर्भ सामग्री को एक संरचित मध्यवर्ती रूप में बदलता है। ComfyUI में स्थानीय रूप से, इसके परिणामस्वरूप 768p आउटपुट मिलता है, लेकिन संदर्भ प्रोसेसिंग को प्रकाशित प्रॉम्प्टिंग गाइड का उपयोग करके दोहराया जा सकता है। खुले वेट्स फाइन-ट्यूनिंग की भी अनुमति देते हैं, उदाहरण के लिए, अपने स्वयं के फुटेज, पात्रों या एक सुसंगत लुक पर, हालांकि लाइसेंस केवल बीस मिलियन डॉलर से कम राजस्व वाली कंपनियों के लिए व्यावसायिक उपयोग की अनुमति देता है। साथ ही, बाइटडांस ने बंद सीडेंस 2.5 जारी किया, जो ऑडियो के साथ तीस सेकंड के क्लिप प्रदान करता है।
स्रोत: The Decoder (DE) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार