⚡ BREAKING

ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया: इमेज, वीडियो, ऑडियो और रोबोट क्रिया पूर्वानुमान के लिए मल्टीमॉडल मॉडल

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
ब्लैक फॉरेस्ट लैब्स (BFL) ने FLUX 3 पेश किया है, जो इमेज, वीडियो, ऑडियो और रोबोट क्रिया पूर्वानुमान पर संयुक्त रूप से प्रशिक्षित एक मल्टीमॉडल फाउंडेशन मॉडल है। यह मॉडल मोडैलिटी को संरेखित करने के लिए Self-Flow आर्किटेक्चर का उपयोग करता है, और शुरुआती परीक्षणों में टेक्स्ट-टू-वीडियो जनरेशन में Luma Ray 3.2 और Runway Gen-4.5 जैसे प्रतिस्पर्धियों पर मजबूत पसंद दिखाई गई है।
ब्लैक फॉरेस्ट लैब्स (बीएफएल) ने FLUX 3 जारी किया है, जो एक मल्टीमॉडल फाउंडेशन मॉडल है जो एक ही आर्किटेक्चर के अंदर इमेज, वीडियो और ऑडियो से सीखता है। यह पहला FLUX मॉडल है जो वीडियो, ऑडियो और एक्शन प्रेडिक्शन को एक ही सेट ऑफ वेट्स (भारों के सेट) से भेजता है। शोध दल का तर्क है कि कोई भी एक मोडैलिटी दुनिया का पूर्ण विवरण नहीं दे सकती, और सभी मोडैलिटी पर एक साथ प्रशिक्षण का मतलब है कि मोडैलिटी एक-दूसरे को बाधित करती हैं। FLUX 3, सेल्फ-फ्लो पर आधारित है, जो मल्टीमॉडल जनरेशन और समझ को संरेखित करने के लिए बीएफएल की विधि है, जो फ्लो मैचिंग ऑब्जेक्टिव को एक सेल्फ-सुपरवाइज्ड फीचर रिकंस्ट्रक्शन ऑब्जेक्टिव के साथ जोड़ती है। FLUX 3 वीडियो एक ही जनरेशन में मूल ऑडियो के साथ 20 सेकंड तक के क्लिप बनाता है, और टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, वीडियो-टू-वीडियो, कीफ्रेम-टू-वीडियो और जनरेटिव वीडियो-ऑडियो कंटिन्यूएशन का समर्थन करता है। बीएफएल मानव चेहरे के भावों और भौतिक घटनाओं के साथ ध्वनियों को जोड़ने में मजबूत प्रदर्शन की रिपोर्ट करता है। 720p पर ऑडियो के साथ 10-सेकंड के टेक्स्ट-टू-वीडियो क्लिप के प्रारंभिक मानव पसंद परीक्षणों में, FLUX 3 को 93% तुलनाओं में लूमा रे 3.2 से अधिक पसंद किया गया, 77% में रनवे जेन-4.5 से, 69% में ग्रोक इमेजिन वीडियो से, 60% में क्लिंग वी3 प्रो से, और क्रमशः 59% और 57% में हैप्पी हॉर्स वी1 और वी1.1 से। सीडेंस 2.0 और जेमिनी ओम्नी फ्लैश के मुकाबले यह 52% तक पहुंच गया। वीडियो प्रेडिक्शन प्रशिक्षण कंप्यूट के 95% से अधिक की खपत करता है, ऑडियो 0.5% से कम टोकन का। वही बैकबोन FLUX-मिमिक चलाता है, जो एक रोबोट पॉलिसी है जो एक RTX 5090 पर 80 मिलीसेकंड से कम समय लेती है। पहुंच गेटेड है: वीडियो और एक्शन प्रारंभिक पहुंच में हैं, फिर इमेज आती है, खुले वेट अंत में आते हैं।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार