⚡ ÚLTIMA HORA
Black Forest Labs lanza FLUX 3: modelo multimodal para imágenes, video, audio y predicción de acciones robóticas
Luma AI
Runway
xAI
Google/DeepMind
Black Forest Labs (BFL) presenta FLUX 3, un modelo fundacional multimodal entrenado conjuntamente en imágenes, video, audio y predicción de acciones robóticas. El modelo aprovecha la arquitectura Self-Flow para alinear modalidades, y las pruebas iniciales muestran una fuerte preferencia sobre competidores como Luma Ray 3.2 y Runway Gen-4.5 en la generación de texto a video.
Black Forest Labs (BFL) ha lanzado FLUX 3, un modelo fundacional multimodal que aprende de imágenes, videos y audio dentro de una única arquitectura. Es el primer modelo FLUX que integra predicción de video, audio y acción a partir de un solo conjunto de pesos. El equipo de investigación sostiene que ninguna modalidad por sí sola ofrece una descripción completa del mundo, y entrenar en todas ellas a la vez significa que las modalidades se restringen mutuamente. FLUX 3 se basa en Self-Flow, el método de BFL para alinear la generación y comprensión multimodal, que combina el objetivo de "flow matching" con un objetivo de reconstrucción de características autosupervisado. FLUX 3 Video genera clips de hasta 20 segundos en una sola generación con audio nativo, y admite conversión de texto a video, de imagen a video, de video a video, de fotograma clave a video y continuación generativa de video y audio. BFL reporta un buen rendimiento en expresiones faciales humanas y en la asociación de sonidos con eventos físicos. En pruebas preliminares de preferencia humana para clips de video de texto a video de 10 segundos a 720p con audio, FLUX 3 fue preferido frente a Luma Ray 3.2 en el 93% de las comparaciones, frente a Runway Gen-4.5 en el 77%, frente a Grok Imagine Video en el 69%, frente a Kling v3 Pro en el 60%, y frente a Happy Horse v1 y 1.1 en el 59% y 57%, respectivamente. Frente a Seedance 2.0 y Gemini Omni Flash alcanzó el 52%. La predicción de video consume más del 95% del cómputo de entrenamiento, mientras que el audio representa menos del 0,5% de los tokens. El mismo backbone ejecuta FLUX-mimic, una política robótica en menos de 80 ms en una RTX 5090. El acceso está restringido: Video y Acción están en acceso temprano, Imagen le sigue, y los pesos abiertos llegan al final.
Fuente: MarkTechPost —
original
