वीडियो पोस्ट-प्रोडक्शन खतरे में: MiniMax H3 हाथ से बनाए चित्रों को इफेक्ट्स में बदलता है, मल्टीमॉडल 'कोडिंग क्षण' आ पहुंचा

MiniMaxMiniMax
MiniMax ने अपना पहला ओपन-सोर्स वीडियो मॉडल H3 जारी किया है, जो संपादन, टाइपोग्राफी, ट्रांज़िशन, पेसिंग, बैकग्राउंड म्यूज़िक और विज़ुअल इफेक्ट्स को एंड-टू-एंड एकीकृत करता है। उपयोगकर्ता टेक्स्ट इनपुट कर सकते हैं और एक रेडी-टू-पब्लिश वीडियो प्राप्त कर सकते हैं, जो डिफ़ॉल्ट रूप से 2K रिज़ॉल्यूशन में होता है। मॉडल को वीडियो संपादन में नया SOTA माना जा रहा है और यह पूर्ण-मोडल इनपुट का समर्थन करता है, जिसमें टेक्स्ट, चित्र, ऑडियो और वीडियो शामिल हैं।
MiniMax ने आधिकारिक तौर पर अपना अगली पीढ़ी का वीडियो मॉडल MiniMax H3 जारी किया है, जो उसका पहला ओपन-सोर्स वीडियो मॉडल भी है। H3 उस पुराने प्रतिमान को तोड़ता है जिसमें वीडियो मॉडल केवल कच्चा फुटेज बनाते थे, और संपादन लॉजिक, टाइपोग्राफी, ट्रांज़िशन डिज़ाइन, रिदम नियंत्रण, पृष्ठभूमि संगीत और विज़ुअल इफेक्ट्स को एंड-टू-एंड एकीकृत करता है। उपयोगकर्ता टेक्स्ट इनपुट कर सकते हैं और प्रकाशन के लिए तैयार एक पूरा वीडियो प्राप्त कर सकते हैं, जिसकी डिफ़ॉल्ट 2K रिज़ॉल्यूशन होती है। मॉडल को विदेशी डेवलपर्स द्वारा अच्छी प्रतिक्रिया मिली है और इसने वीडियो संपादन के लिए Artificial Analysis लीडरबोर्ड में शीर्ष स्थान प्राप्त किया है। लेखक ने H3 का परीक्षण किया और पाया कि यह उपयोगकर्ता के इरादे के प्रति अत्यधिक संवेदनशील है, यहां तक कि जटिल मल्टी-शॉट प्रॉम्प्ट का भी सटीक रूप से पालन करता है। H3 वीडियो में टेक्स्ट उत्पन्न करने में भी महत्वपूर्ण सुधार दर्शाता है, जो AI वीडियो मॉडल के लिए एक सामान्य विफलता बिंदु रहा है। यह ऐसा टेक्स्ट उत्पन्न कर सकता है जो फ़्रेमों में सुसंगत रहता है और टेक्स्ट तथा विज़ुअल सामग्री के बीच संबंध को भी समझता है। इसके अतिरिक्त, H3 संवाद के लिए इनपुट के रूप में एक ऑडियो क्लिप ले सकता है, जिसमें आवाज़ विज़ुअल की भावना और लय के साथ सिंक होती है, जो MiniMax की मल्टीमॉडल वॉयस मॉडल में विशेषज्ञता पर आधारित है। मूल्य कम है, 2K रिज़ॉल्यूशन पर प्रति सेकंड की लागत मुख्यधारा के मॉडलों के एक तिहाई से भी कम है। H3 फुल-मोडल इनपुट का समर्थन करता है, जिसका अर्थ है कि सभी प्रकार के मीडिया मॉडल के संदर्भ का हिस्सा हैं। यह एक कस्टम कैप्शन मॉडल और H3-Omni Transformer आर्किटेक्चर का उपयोग करता है जो कुशल मल्टीमॉडल प्रोसेसिंग के लिए है। MiniMax का दृष्टिकोण मल्टीमॉडल प्लस भाषा के उद्भव पर आधारित है, जो अलग-अलग मोडैलिटी को भाषा के माध्यम से जोड़ता है। H3 की ओपन-सोर्स प्रकृति उद्यमों को कस्टम सामग्री वर्कफ़्लो के लिए निजी तौर पर तैनात और फाइन-ट्यून करने की अनुमति देती है, जिससे संभावित रूप से IP जीवंतता का विस्फोट हो सकता है। MiniMax के पास मॉडलों को ओपन-सोर्स करने का एक इतिहास है, M2 सीरीज़ से लेकर अब H3 तक, जो इसके 'सभी के साथ बुद्धिमत्ता' के दृष्टिकोण के अनुरूप है। यह रिलीज़ वीडियो जनरेशन को एक 'कोडिंग क्षण' में स्थानांतरित करने का संकेत देती है, जहां यह एक व्यावसायिक रूप से व्यवहार्य उत्पादन उपकरण बन जाता है।
स्रोत: QbitAI 量子位 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार