MiniMax ने जारी किया MiniMax H3: 15-सेकंड 2K क्लिप्स जेनरेट करने वाला ओम्नी-मोडल वीडियो मॉडल, नेटिव स्टीरियो ऑडियो के साथ

MiniMaxMiniMax Google/DeepMindGoogle/DeepMind ByteDanceByteDance
MiniMax ने MiniMax H3 का अनावरण किया है, जो एक सामान्य-उद्देश्य मल्टीमोडल जेनरेशन मॉडल है जो टेक्स्ट, इमेज, वीडियो और ऑडियो प्रोसेसिंग को एकीकृत करता है, और नेटिव स्टीरियो ध्वनि के साथ 2K वीडियो आउटपुट करता है। यह मॉडल API के माध्यम से और Hailuo AI ऐप में उपलब्ध है, जिसके वेट जल्द ही खुले करने का वादा किया गया है। आक्रामक मूल्य निर्धारण के साथ, H3 वीडियो एडिटिंग में अग्रणी है, लेकिन अन्य बेंचमार्क्स में प्रतिस्पर्धियों से पीछे है।
MiniMax ने MiniMax H3 जारी किया, जो एक सामान्य-उद्देश्य वाला मल्टीमॉडल जनरेशन मॉडल है जो टेक्स्ट, इमेज, वीडियो और ऑडियो को एकीकृत संदर्भ के रूप में पढ़ता है और नेटिव स्टीरियो ऑडियो के साथ वीडियो लौटाता है, जो 2K रिज़ॉल्यूशन, 4 से 15 सेकंड (केवल पूर्णांक) की अवधि का समर्थन करता है। पिछले स्टैक के विपरीत, जिन्हें टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और अन्य कार्यों के लिए अलग-अलग मॉडल की आवश्यकता होती थी, H3 इन्हें एक ही प्रीट्रेनिंग प्रतिमान में समेटता है जहाँ संबंधों को प्राकृतिक भाषा में व्यक्त किया जाता है, जैसे कि वीडियो से कैमरा मूवमेंट का संदर्भ देना या ऑडियो से मेल खाते स्वर। मॉडल 31 जुलाई, 2026 को लॉन्च किया गया, जो मॉडल आईडी MiniMax-H3 के तहत API और उपभोक्ता Hailuo AI ऐप में उपलब्ध है। यह विज्ञापन, ब्रांडिंग, ई-कॉमर्स, उत्पाद डिज़ाइन, UI/UX, गेमिंग, फ़िल्म प्री-विज़ुअलाइज़ेशन और रिटेल कैटलॉग मीडिया के लिए स्थित है, जिसमें विज्ञापन वेरिएंट, उत्पाद वीडियो, एनिमेटेड पोस्टर और वीडियो-टू-वीडियो मोशन ट्रांसफर जैसे अनुप्रयोग शामिल हैं। API तीन प्रवेश मोड का समर्थन करता है—टेक्स्ट-टू-वीडियो, पहले/आखिरी फ्रेम इमेज-टू-वीडियो, और संदर्भ जनरेशन—इनपुट सीमाओं के साथ जिसमें अधिकतम 9 संदर्भ इमेज, 3 संदर्भ वीडियो (प्रत्येक 2-15 सेकंड, कुल ≤15 सेकंड), और 3 संदर्भ ऑडियो क्लिप (ऑडियो के लिए साथ में इमेज/वीडियो आवश्यक) शामिल हैं। मिश्रित इनपुट अधिकतम 12 फ़ाइलें; प्रॉम्प्ट ≤7,000 अक्षर; अनुरोध बॉडी ≤64 MB; फ़ाइल आकार: वीडियो ≤50 MB, इमेज ≤30 MB, ऑडियो ≤15 MB। प्रारूपों में H.264/H.265 वीडियो, JPG/PNG/WEBP/HEIC/HEIF इमेज, और WAV/MP3 ऑडियो शामिल हैं। चार तकनीकी घटक इसके प्रदर्शन को सक्षम करते हैं: कॉन्टेक्स्टुअल ऑम्नी रिप्रेजेंटेशन (कैप्शनिंग जो संबंधों का वर्णन करती है, ~100K टोकन को ~4K में आसवित करती है), H3-VAE (एक टोकनाइज़र जो 4× प्रभावी अनुक्रम-लंबाई लाभ के साथ नेटिव 2K सक्षम करता है), H3-ऑम्नी ट्रांसफॉर्मर (समझ और जनरेशन कार्यभार को अलग करता है, प्रशिक्षण थ्रूपुट लगभग 30% बढ़ाता है), और इन-कॉन्टेक्स्ट रीजनरेशन (बेस मॉडल सुपर-रिज़ॉल्यूशन जोड़ने के बजाय इन-कॉन्टेक्स्ट में कम-रिज़ॉल्यूशन आउटपुट को पुनर्जीवित करता है)। मूल्य दावे: 2K पर, प्रति-सेकंड मूल्य मुख्यधारा मॉडल के एक तिहाई से कम है; 768p पर, मुख्यधारा 720p के आधे से कम। तीसरे पक्ष के ट्रैकर्स $0.13 प्रति सेकंड (~$1.95 प्रति 15-सेकंड क्लिप) की रिपोर्ट करते हैं, लेकिन MiniMax का पे-एज़-यू-गो पृष्ठ अभी भी Hailuo 2.3 स्तरों को सूचीबद्ध करता है। SCMP के अनुसार आर्टिफिशियल एनालिसिस का हवाला देते हुए, H3 वीडियो संपादन में अग्रणी है, टेक्स्ट-टू-वीडियो में Google के जेमिनी ऑम्नि फ्लैश से पीछे है, और इमेज-टू-वीडियो में सीडेंस 2.0 और जेमिनी ऑम्नि फ्लैश से पीछे है। ओपन वेट्स 'आने वाले दिनों में' देने का वादा किया गया है, लेकिन अभी तक जारी नहीं किए गए हैं।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार