MiniMax H3 पहला ओपन वीडियो मॉडल बनकर वीडियो एडिटिंग रैंकिंग में शीर्ष पर पहुंचा
MiniMax
ByteDance
MiniMax ने अपने वीडियो मॉडल H3 के वेट्स जारी किए हैं, जिससे यह पहला ओपन मॉडल बन गया है जो वीडियो रैंकिंग में शीर्ष स्थान पर पहुंचा है। Artificial Analysis के अनुसार, H3 वीडियो एडिटिंग में पहले, टेक्स्ट-टू-वीडियो में दूसरे, और इमेज-टू-वीडियो में तीसरे स्थान पर है। 33 अरब पैरामीटर वाला यह मॉडल टेक्स्ट, इमेज, वीडियो और ऑडियो को एक साथ प्रोसेस करता है, स्टीरियो साउंड के साथ क्लिप बनाता है, लेकिन कुछ घटक अभी भी बंद हैं।
मिनीमैक्स ने अपने वीडियो मॉडल H3 के वेट्स को सार्वजनिक रूप से उपलब्ध करा दिया है, जो वीडियो रैंकिंग में शीर्ष पर पहुंचने वाला पहला ओपन मॉडल है। आर्टिफिशियल एनालिसिस पर, H3 वीडियो एडिटिंग में पहले, टेक्स्ट-टू-वीडियो में दूसरे और इमेज-टू-वीडियो में तीसरे स्थान पर है। 33 अरब पैरामीटर वाला मॉडल टेक्स्ट, इमेज, वीडियो और ऑडियो को एक साथ प्रोसेस करता है, और स्टीरियो साउंड के साथ चार से पंद्रह सेकंड का क्लिप तैयार करता है। मॉडल कार्ड के अनुसार, यह प्रति प्रॉम्प्ट नौ संदर्भ इमेज, तीन वीडियो क्लिप और तीन ऑडियो क्लिप तक संभाल सकता है। हालाँकि, दो घटक बंद हैं: 2K रिज़ॉल्यूशन के लिए मॉड्यूल और H3-Context-IR, जो प्रॉम्प्ट और संदर्भ सामग्री को एक संरचित मध्यवर्ती रूप में बदलता है। ComfyUI में स्थानीय रूप से, इसके परिणामस्वरूप 768p आउटपुट मिलता है, लेकिन संदर्भ प्रोसेसिंग को प्रकाशित प्रॉम्प्टिंग गाइड का उपयोग करके दोहराया जा सकता है। खुले वेट्स फाइन-ट्यूनिंग की भी अनुमति देते हैं, उदाहरण के लिए, अपने स्वयं के फुटेज, पात्रों या एक सुसंगत लुक पर, हालांकि लाइसेंस केवल बीस मिलियन डॉलर से कम राजस्व वाली कंपनियों के लिए व्यावसायिक उपयोग की अनुमति देता है। साथ ही, बाइटडांस ने बंद सीडेंस 2.5 जारी किया, जो ऑडियो के साथ तीस सेकंड के क्लिप प्रदान करता है।
स्रोत: The Decoder (DE) —
मूल
