Black Forest Labs Releases FLUX 3: Multimodal Model for Images, Video, Audio, and Robot Action Prediction

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
Black Forest Labs (BFL) has introduced FLUX 3, a multimodal foundation model trained on images, video, and audio within a single architecture. The model generates up to 20-second videos with synchronized audio and achieves high user preference results, surpassing Luma Ray 3.2 in 93% of cases and Runway Gen-4.5 in 77%.
Black Forest Labs (BFL) टीम ने FLUX 3 जारी किया है — एक मल्टीमॉडल फाउंडेशनल मॉडल जो एक ही आर्किटेक्चर में इमेज, वीडियो और ऑडियो पर प्रशिक्षित होता है। यह पहला FLUX मॉडल है जो एक ही वेट सेट से वीडियो, ऑडियो जनरेट करने और क्रियाओं की भविष्यवाणी करने में सक्षम है। BFL के शोधकर्ताओं का कहना है कि कोई भी एकल मोडैलिटी दुनिया का पूर्ण विवरण नहीं देती: इमेज एक पल में स्थानिक संरचना को कैप्चर करती हैं, वीडियो समय को पुनर्स्थापित करता है और भौतिक गतिशीलता को प्रकट करता है, ऑडियो यांत्रिक घटनाओं और ध्वनि के बीच कारण-कार्य संबंधों को उजागर करता है। सभी मोडैलिटी पर एक साथ प्रशिक्षण उन्हें एक-दूसरे को सीमित करने के लिए मजबूर करता है — ध्वनि को टकराव से मेल खाना चाहिए, गति को द्रव्यमान के अनुसार होना चाहिए। मॉडल के केंद्र में Self-Flow विधि है, जो फ्लो मैचिंग उद्देश्य को स्व-अनुकूलन फीचर पुनर्निर्माण उद्देश्य के साथ जोड़ता है। GitHub पर संदर्भ कार्यान्वयन (ImageNet 256×256) फ्रेमवार टेम्पोरल कंडीशनिंग, 25% मास्क और EMA शिक्षक से लेयर 20 पर छात्र (लेयर 8) तक सेल्फ-डिस्टिलेशन के साथ SiT-XL/2 का उपयोग करता है। FLUX 3 के लिए, BFL ने वीडियो, इमेज और ऑडियो पर एक साथ मॉडल प्रशिक्षित करके कम्प्यूटेशनल और डेटा संसाधनों में उल्लेखनीय वृद्धि की। FLUX 3 Video एक ही पास में नेटिव ऑडियो के साथ 20 सेकंड तक के क्लिप जनरेट करता है, और text-to-video, image-to-video, video-to-video, keyframe-to-video और जनरेटिव वीडियो-ऑडियो एक्सटेंशन मोड का समर्थन करता है। BFL बहुभाषी संवाद, एजेंट-आधारित क्लिप असेंबली को मल्टी-सीन अनुक्रमों में और एनिमेशन के साथ गुणवत्तापूर्ण टाइपोग्राफी जनरेशन की क्षमताओं पर भी प्रकाश डालता है। मानव चेहरे की अभिव्यक्ति जनरेशन और भौतिक घटनाओं के साथ ध्वनियों के जुड़ाव में मॉडल विशेष रूप से मजबूत है। प्रारंभिक उपयोगकर्ता वरीयता परीक्षणों में, FLUX 3 ने Luma Ray 3.2 को 93% मामलों में, Runway Gen-4.5 को 77% में, Grok Imagine Video को 69% तक, Kling v3 Pro को 60%, Happy Horse v1 को 59% और Happy Horse 1.1 को 57% में हराया। Seedance 2.0 और Gemini Omni Flash के मुकाबले परिणाम 52% रहा। वीडियो भविष्यवाणी प्रशिक्षण कम्प्यूटेशनल संसाधनों का 95% से अधिक उपभोग करती है, ऑडियो 0.5% से कम टोकन का उपयोग करता है। इसी आधार का उपयोग FLUX-mimic — रोबोट पॉलिसी — के लिए किया जाता है, जो एक ही RTX 5090 पर 80 मिलीसेकंड (ms) से कम समय में काम करती है। पहुंच सीमित है: वीडियो और क्रियाएं अर्ली एक्सेस में हैं, इमेज बाद में, ओपन वेट सबसे बाद में।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार