ModelleMediengenerierung 🇺🇸 26.07.2026 21:02

Black Forest Labs veröffentlicht FLUX 3: Multimodales Modell für Bilder, Video, Audio und Robotervorhersage

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
Black Forest Labs (BFL) hat FLUX 3 vorgestellt, ein multimodales Foundation-Modell, das innerhalb einer einzigen Architektur auf Bildern, Video und Audio trainiert wurde. Das Modell generiert bis zu 20 Sekunden lange Videos mit synchronisiertem Audio und erzielt hohe Benutzerpräferenzwerte, wobei es Luma Ray 3.2 in 93 % der Fälle und Runway Gen-4.5 in 77 % der Fälle übertrifft.
Das Unternehmen Black Forest Labs (BFL) hat FLUX 3 veröffentlicht, ein multimodales fundamentales Modell, das auf Bildern, Videos und Audio in einer einheitlichen Architektur trainiert wird. Es ist das erste FLUX-Modell, das aus einem einzigen Gewichtssatz Videos, Audio und Aktionsvorhersagen generieren kann. Die Forscher von BFL argumentieren, dass keine einzelne Modalität eine vollständige Beschreibung der Welt liefert: Bilder erfassen die räumliche Struktur in einem Moment, Videos stellen die Zeit wieder her und enthüllen die physikalische Dynamik, Audio deckt kausale Zusammenhänge zwischen mechanischen Ereignissen und Klang auf. Das gleichzeitige Training auf allen Modalitäten zwingt sie dazu, sich gegenseitig einzuschränken – der Klang muss mit dem Aufprall übereinstimmen, die Bewegung muss der Masse gehorchen. Das Modell basiert auf der Self-Flow-Methode, die das Flow-Matching-Ziel mit einem selbstjustierenden Feature-Rekonstruktionsziel kombiniert. Die Referenzimplementierung auf GitHub (ImageNet 256×256) verwendet SiT-XL/2 mit frameweiser temporaler Konditionierung, 25% Maskierung und Self-Distillation von einem EMA-Teacher auf Schicht 20 zu einem Studenten auf Schicht 8. Für FLUX 3 hat BFL die Rechen- und Datenressourcen erheblich erweitert und das Modell gleichzeitig auf Videos, Bildern und Audio trainiert. FLUX 3 Video generiert Clips von bis zu 20 Sekunden in einem Durchgang mit nativen Audio und unterstützt die Modi Text-to-Video, Image-to-Video, Video-to-Video, Keyframe-to-Video und generative Video-Audio-Verlängerung. BFL hebt auch die Fähigkeiten für mehrsprachige Dialoge, agentische Zusammenstellung von Clips zu mehrszenigen Sequenzen und die Erzeugung hochwertiger Typografie mit Animation hervor. Besonders stark ist das Modell bei der Generierung menschlicher Gesichtsausdrücke und der Assoziation von Geräuschen mit physikalischen Ereignissen. In vorläufigen Benutzerpräferenztests gewann FLUX 3 in 93% der Fälle gegen Luma Ray 3.2, gegen Runway Gen-4.5 in 77%, gegen Grok Imagine Video bis zu 69%, gegen Kling v3 Pro mit 60%, gegen Happy Horse v1 mit 59% und gegen Happy Horse 1.1 mit 57%. Gegen Seedance 2.0 und Gemini Omni Flash betrug das Ergebnis 52%. Die Videovorhersage verbraucht über 95% der Rechenressourcen für das Training, Audio weniger als 0,5% der Tokens. Dieselbe Grundlage wird für FLUX-mimic verwendet, eine Roboterpolitik, die auf einer einzelnen RTX 5090 in unter 80 Millisekunden arbeitet. Der Zugang ist eingeschränkt: Video und Aktionen im frühen Zugang, Bilder später, offene Gewichte zuletzt.
Quelle: MarkTechPost — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten