⚡ EILMELDUNG
Black-Forest-Labs veröffentlicht FLUX 3: multimodales Modell für Bilder, Video, Audio und Robotik-Aktionsvorhersage
Luma AI
Runway
xAI
Google/DeepMind
Black Forest Labs (BFL) stellt FLUX 3 vor, ein multimodales Foundation-Modell, das gemeinsam auf Bildern, Video, Audio und Robotik-Aktionsvorhersage trainiert wurde. Das Modell nutzt die Self-Flow-Architektur, um Modalitäten auszurichten, und frühe Tests zeigen eine starke Präferenz gegenüber Konkurrenten wie Luma Ray 3.2 und Runway Gen-4.5 bei der Text-zu-Video-Generierung.
Black Forest Labs (BFL) hat FLUX 3 veröffentlicht, ein multimodales Foundation-Modell, das in einer einzigen Architektur aus Bildern, Videos und Audiodaten lernt. Es ist das erste FLUX-Modell, das Video-, Audio- und Aktionsvorhersage aus einem einzigen Gewichtssatz ausliefert. Das Forschungsteam argumentiert, dass keine einzelne Modalität eine vollständige Beschreibung der Welt liefert und das Training auf allen gleichzeitig dazu führt, dass sich die Modalitäten gegenseitig einschränken. FLUX 3 baut auf Self-Flow auf, BFLs Methode zur Angleichung von multimodaler Generierung und Verständnis, die das Flow-Matching-Ziel mit einem selbstüberwachten Merkmalsrekonstruktionsziel kombiniert. FLUX 3 Video generiert Clips von bis zu 20 Sekunden Länge in einer einzigen Generierung mit nativen Audio und unterstützt Text-zu-Video, Bild-zu-Video, Video-zu-Video, Keyframe-zu-Video und generative Video-Audio-Fortsetzung. BFL berichtet von starker Leistung bei menschlichen Gesichtsausdrücken und der Zuordnung von Geräuschen zu physikalischen Ereignissen. In vorläufigen menschlichen Präferenztests für 10-sekündige Text-zu-Video-Clips in 720p mit Audio wurde FLUX 3 gegenüber Luma Ray 3.2 in 93 % der Vergleiche bevorzugt, gegenüber Runway Gen-4.5 in 77 %, gegenüber Grok Imagine Video in 69 %, gegenüber Kling v3 Pro in 60 % und gegenüber Happy Horse v1 und 1.1 in 59 % beziehungsweise 57 %. Gegen Seedance 2.0 und Gemini Omni Flash erreichte es 52 %. Die Videovorhersage verbraucht über 95 % der Trainingsrechenleistung, Audio unter 0,5 % der Tokens. Das gleiche Backbone betreibt FLUX-mimic, eine Robotersteuerung unter 80 ms auf einer einzelnen RTX 5090. Der Zugang ist abgestuft: Video und Action befinden sich im Early Access, Bild folgt, offene Gewichte kommen zuletzt.
Quelle: MarkTechPost —
Original
