MiniMax H3: न्यूरल नेटवर्क जो निर्देशित करता है, ध्वनि उत्पन्न करता है, और स्वयं संपादन करता है
MiniMax ने H3 (जिसे Hailuo 3.0 भी कहा जाता है) जारी किया है, जो एक मल्टीमॉडल AI मॉडल है जो सिंक्रनाइज़ ऑडियो के साथ वीडियो उत्पन्न करता है, संदर्भ वीडियो का अनुसरण करते हुए संपादन करता है, और ग्रीन स्क्रीन हटाने का कार्य भी करता है। यह मॉडल लाइसेंस के तहत ओपन-सोर्स है, जिसके वेट Hugging Face पर उपलब्ध हैं, और API के माध्यम से 2K रिज़ॉल्यूशन तक समर्थन करता है। इसका उद्देश्य टेक्स्ट, छवि, वीडियो और ऑडियो प्रोसेसिंग को एक ही संदर्भ में एकीकृत करना है।
MiniMax ने H3 जारी किया है, जिसे Hailuo 3.0 या Hailuo 03 के नाम से भी जाना जाता है। यह एक मल्टीमॉडल मॉडल है जो 24 फ्रेम प्रति सेकंड पर 4-15 सेकंड के वीडियो बना सकता है, जिसमें 32 kHz पर नेटिव स्टीरियो ऑडियो शामिल है, और API के माध्यम से 2K रिज़ॉल्यूशन तक या सेल्फ-होस्टेड होने पर 768p तक का सपोर्ट करता है। यह मॉडल एक साथ 9 संदर्भ छवियाँ, 3 वीडियो, और 3 ऑडियो फ़ाइलें ले सकता है, और वीडियो को संदर्भ क्लिप के समय और शैली से मेल खाने के लिए संपादित कर सकता है। यह ग्रीन स्क्रीन हटाने और प्रकाश समायोजित करने में भी सक्षम है। आर्किटेक्चर स्रोतों को भाषा विवरणों में संपीड़ित करता है (लगभग 100k टोकन को 4k तक कम करता है), एक पुन: डिज़ाइन किए गए VAE टोकनाइज़र का उपयोग करता है जिसमें प्रभावी अनुक्रम लंबाई चार गुना बढ़ जाती है, और समझने और निर्माण के लिए अलग गणना शामिल है। MiniMax ने 31 जुलाई 2026 को API लॉन्च के कुछ दिनों बाद, 2-3 अगस्त 2026 को हगिंग फेस पर मॉडल के वेट जारी किए। प्रदर्शनों से पता चलता है कि मॉडल संपादन, विज्ञापन और सहज संक्रमण के लिए जटिल प्रॉम्प्ट्स को संभाल सकता है, लेकिन यह अभी भी वीडियो में छोटे टेक्स्ट के साथ संघर्ष करता है, जो जनरेटिव वीडियो मॉडल की एक सामान्य कमज़ोरी है।
स्रोत: Habr — хаб ИИ —
मूल
