MallitMediatuotanto 🇺🇸 26.07.2026 21:02

Black Forest Labs julkaisee FLUX 3:n: multimodaalinen malli kuville, videolle, äänelle ja robottitoimintojen ennustamiselle

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
Black Forest Labs (BFL) on esitellyt FLUX 3 -mallin, multimodaalisen perustan mallin, joka on koulutettu kuvilla, videolla ja äänellä yhden arkkitehtuurin sisällä. Malli tuottaa jopa 20 sekunnin videoita synkronoidulla äänellä ja saavuttaa korkeat käyttäjien mieltymystulokset, ohittaen Luma Ray 3.2:n 93 prosentissa tapauksista ja Runway Gen-4.5:n 77 prosentissa.
Black Forest Labs (BFL) -yhtiö on julkaissut FLUX 3 -multimodaalisen perusmallin, joka oppii kuvista, videoista ja äänestä yhden arkkitehtuurin alla. Tämä on ensimmäinen FLUX-malli, joka pystyy tuottamaan videoita, ääntä ja ennustamaan toimintoja yhdestä painojoukosta. BFL:n tutkijoiden mukaan mikään yksittäinen modaliteetti ei anna täydellistä kuvausta maailmasta: kuvat tallentavat spatiaalisen rakenteen yhdellä hetkellä, video palauttaa ajan ja paljastaa fysiikan dynamiikan, ja ääni paljastaa syy-seuraussuhteita mekaanisten tapahtumien ja äänen välillä. Kaikkien modaliteettien samanaikainen oppiminen pakottaa ne rajoittamaan toisiaan – äänen täytyy vastata törmäystä, liikkeen noudattaa massaa. Mallin perustana on Self-Flow -menetelmä, joka yhdistää flow-tavoitteen itsevirittävään piirteiden rekonstruktiotavoitteeseen. GitHubissa oleva vertailutoteutus (ImageNet 256×256) käyttää SiT-XL/2:ta, kehystason ajallista ehdollistamista, 25 % maskia ja itsetislautumista EMA-opettajalta kerroksesta 20 opiskelijan kerrokseen 8. FLUX 3:ssa BFL on merkittävästi lisännyt laskenta- ja datavaroja, kouluttaen mallia samanaikaisesti videoista, kuvista ja äänestä. FLUX 3 Video tuottaa jopa 20 sekunnin pituisia leikkeitä yhdellä kertaa ja natiivilla äänellä, ja tukee text-to-video-, image-to-video-, video-to-video-, keyframe-to-video- ja tuottavaa video-äänen jatkamistiloja. BFL korostaa myös monikielisen vuoropuhelun mahdollisuuksia, agenttipohjaista leikkeiden kokoamista monikohtauksiksi sekvensseiksi ja laadukkaan typografian tuottamista animaatiolla. Malli on erityisen vahva ihmisten ilmeiden tuottamisessa ja fyysisten tapahtumien ja äänien yhdistämisessä. Alustavissa käyttäjien mieltymystesteissä FLUX 3 voitti Luma Ray 3.2:n 93 % tapauksista, Runway Gen-4.5:n 77 %, Grok Imagine Videon jopa 69 %, Kling v3 Pron 60 %, Happy Horse v1:n 59 % ja Happy Horse 1.1:n 57 %. Seedance 2.0 ja Gemini Omni Flash vastaan tulos oli 52 %. Videon ennustaminen kuluttaa yli 95 % laskentaresursseista koulutuksessa, ääni alle 0,5 % tokeneista. Samaa perustaa käytetään FLUX-mimicissä, robottipolitiikassa, joka toimii alle 80 ms yhdellä RTX 5090:llä. Saatavuus on rajoitettu: videot ja toiminnot ovat varhaisvaiheen käytössä, kuvat myöhemmin, avoimet painot viimeisenä.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset