⚡ BREAKING
ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया: इमेज, वीडियो, ऑडियो और रोबोट क्रिया पूर्वानुमान के लिए मल्टीमॉडल मॉडल
Luma AI
Runway
xAI
Google/DeepMind
ब्लैक फॉरेस्ट लैब्स (BFL) ने FLUX 3 पेश किया है, जो इमेज, वीडियो, ऑडियो और रोबोट क्रिया पूर्वानुमान पर संयुक्त रूप से प्रशिक्षित एक मल्टीमॉडल फाउंडेशन मॉडल है। यह मॉडल मोडैलिटी को संरेखित करने के लिए Self-Flow आर्किटेक्चर का उपयोग करता है, और शुरुआती परीक्षणों में टेक्स्ट-टू-वीडियो जनरेशन में Luma Ray 3.2 और Runway Gen-4.5 जैसे प्रतिस्पर्धियों पर मजबूत पसंद दिखाई गई है।
ब्लैक फॉरेस्ट लैब्स (बीएफएल) ने FLUX 3 जारी किया है, जो एक मल्टीमॉडल फाउंडेशन मॉडल है जो एक ही आर्किटेक्चर के अंदर इमेज, वीडियो और ऑडियो से सीखता है। यह पहला FLUX मॉडल है जो वीडियो, ऑडियो और एक्शन प्रेडिक्शन को एक ही सेट ऑफ वेट्स (भारों के सेट) से भेजता है। शोध दल का तर्क है कि कोई भी एक मोडैलिटी दुनिया का पूर्ण विवरण नहीं दे सकती, और सभी मोडैलिटी पर एक साथ प्रशिक्षण का मतलब है कि मोडैलिटी एक-दूसरे को बाधित करती हैं। FLUX 3, सेल्फ-फ्लो पर आधारित है, जो मल्टीमॉडल जनरेशन और समझ को संरेखित करने के लिए बीएफएल की विधि है, जो फ्लो मैचिंग ऑब्जेक्टिव को एक सेल्फ-सुपरवाइज्ड फीचर रिकंस्ट्रक्शन ऑब्जेक्टिव के साथ जोड़ती है। FLUX 3 वीडियो एक ही जनरेशन में मूल ऑडियो के साथ 20 सेकंड तक के क्लिप बनाता है, और टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, वीडियो-टू-वीडियो, कीफ्रेम-टू-वीडियो और जनरेटिव वीडियो-ऑडियो कंटिन्यूएशन का समर्थन करता है। बीएफएल मानव चेहरे के भावों और भौतिक घटनाओं के साथ ध्वनियों को जोड़ने में मजबूत प्रदर्शन की रिपोर्ट करता है। 720p पर ऑडियो के साथ 10-सेकंड के टेक्स्ट-टू-वीडियो क्लिप के प्रारंभिक मानव पसंद परीक्षणों में, FLUX 3 को 93% तुलनाओं में लूमा रे 3.2 से अधिक पसंद किया गया, 77% में रनवे जेन-4.5 से, 69% में ग्रोक इमेजिन वीडियो से, 60% में क्लिंग वी3 प्रो से, और क्रमशः 59% और 57% में हैप्पी हॉर्स वी1 और वी1.1 से। सीडेंस 2.0 और जेमिनी ओम्नी फ्लैश के मुकाबले यह 52% तक पहुंच गया। वीडियो प्रेडिक्शन प्रशिक्षण कंप्यूट के 95% से अधिक की खपत करता है, ऑडियो 0.5% से कम टोकन का। वही बैकबोन FLUX-मिमिक चलाता है, जो एक रोबोट पॉलिसी है जो एक RTX 5090 पर 80 मिलीसेकंड से कम समय लेती है। पहुंच गेटेड है: वीडियो और एक्शन प्रारंभिक पहुंच में हैं, फिर इमेज आती है, खुले वेट अंत में आते हैं।
स्रोत: MarkTechPost —
मूल
