ModellenMediageneratie 🇺🇸 26.07.2026 21:02

Black Forest Labs brengt FLUX 3 uit: multimodaal model voor afbeeldingen, video, audio en robotactievoorspelling

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
Black Forest Labs (BFL) heeft FLUX 3 geïntroduceerd, een multimodaal basismodel dat is getraind op afbeeldingen, video en audio binnen één enkele architectuur. Het model genereert video's van maximaal 20 seconden met gesynchroniseerd geluid en behaalt hoge gebruikersvoorkeursresultaten, waarbij het in 93% van de gevallen Luma Ray 3.2 overtreft en in 77% van de gevallen Runway Gen-4.5.
Black Forest Labs (BFL) heeft FLUX 3 uitgebracht, een multimodale fundamentele model dat wordt getraind op afbeeldingen, video en audio in één architectuur. Dit is het eerste FLUX-model dat video, audio kan genereren en acties kan voorspellen vanuit één set gewichten. BFL-onderzoekers stellen dat geen enkele aparte modaliteit een volledige beschrijving van de wereld geeft: afbeeldingen leggen de ruimtelijke structuur op één moment vast, video herstelt de tijd en onthult fysieke dynamiek, audio legt causale verbanden bloot tussen mechanische gebeurtenissen en geluid. Gelijktijdig trainen op alle modaliteiten dwingt hen om elkaar te beperken: geluid moet overeenkomen met een botsing, beweging moet massa gehoorzamen. De kern van het model is de Self-Flow-methode, die het stroomafstemmingsdoel combineert met een zelfinstellend kenmerkreconstructiedoel. De referentie-implementatie op GitHub (ImageNet 256×256) gebruikt SiT-XL/2 met per-frametemporele conditionering, een masker van 25% en zelfdestillatie van een EMA-leraar op laag 20 naar een student op laag 8. Voor FLUX 3 heeft BFL de reken- en databronnen aanzienlijk uitgebreid, door het model gelijktijdig te trainen op video, afbeeldingen en audio. FLUX 3 Video genereert clips tot 20 seconden in één doorgang met native audio, en ondersteunt de modi tekst-naar-video, afbeelding-naar-video, video-naar-video, keyframe-naar-video en generatieve verlenging van video-audio. BFL benadrukt ook de mogelijkheden voor meertalige dialoog, het samenstellen van clips in meerdere scènes via een agent en het genereren van typografie van hoge kwaliteit met animatie. Het model is bijzonder sterk in het genereren van menselijke gezichtsuitdrukkingen en het associëren van geluiden met fysieke gebeurtenissen. In voorlopige gebruikerstests versloeg FLUX 3 Luma Ray 3.2 in 93% van de gevallen, Runway Gen-4.5 in 77%, Grok Imagine Video tot 69%, Kling v3 Pro in 60%, Happy Horse v1 in 59% en Happy Horse 1.1 in 57%. Tegen Seedance 2.0 en Gemini Omni Flash was het resultaat 52%. Videovoorspelling verbruikt meer dan 95% van de rekenkracht tijdens training, audio minder dan 0,5% van de tokens. Dezelfde basis wordt gebruikt voor FLUX-mimic, een robotbeleid dat in minder dan 80 ms draait op een enkele RTX 5090. De toegang is beperkt: video en acties zijn in vroege toegang, afbeeldingen komen later, open gewichten komen als laatste.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws