Black Forest Labs lanza FLUX 3: modelo multimodal para imágenes, video, audio y predicción de acciones robóticas
Luma AI
Runway
xAI
Google/DeepMind
Black Forest Labs (BFL) ha presentado FLUX 3, un modelo fundacional multimodal entrenado en imágenes, video y audio dentro de una única arquitectura. El modelo genera videos de hasta 20 segundos con audio sincronizado y obtiene altos resultados de preferencia de usuarios, superando a Luma Ray 3.2 en el 93% de los casos y a Runway Gen-4.5 en el 77%.
Black Forest Labs (BFL) ha lanzado FLUX 3, un modelo fundamental multimodal que se entrena con imágenes, vídeo y audio en una única arquitectura. Es el primer modelo FLUX capaz de generar vídeo, audio y predecir acciones a partir de un solo conjunto de pesos. Los investigadores de BFL sostienen que ninguna modalidad por sí sola ofrece una descripción completa del mundo: las imágenes capturan la estructura espacial en un instante, el vídeo restaura el tiempo y revela la dinámica física, y el audio descubre relaciones causales entre eventos mecánicos y sonido. El entrenamiento en todas las modalidades simultáneamente hace que se restrinjan mutuamente: el sonido debe corresponder a una colisión, el movimiento debe obedecer a la masa. La base del modelo es el método Self-Flow, que combina el objetivo de alineación del flujo con un objetivo de reconstrucción de características autoajustable. La implementación de referencia en GitHub (ImageNet 256×256) utiliza SiT-XL/2 con acondicionamiento temporal cuadro a cuadro, una máscara del 25% y autodestilación desde un profesor EMA en la capa 20 hasta un estudiante en la capa 8. Para FLUX 3, BFL ha aumentado significativamente los recursos computacionales y de datos, entrenando el modelo simultáneamente con vídeo, imágenes y audio. FLUX 3 Video genera clips de hasta 20 segundos en una sola pasada con audio nativo, y admite modos de text-to-video, image-to-video, video-to-video, keyframe-to-video y continuación generativa de vídeo y audio. BFL también destaca capacidades de diálogo multilingüe, ensamblaje agéntico de clips en secuencias multiescena y generación de tipografía de calidad con animación. El modelo es especialmente fuerte en la generación de expresiones faciales humanas y en la asociación de sonidos con eventos físicos. En pruebas de preferencia de usuarios, FLUX 3 derrotó a Luma Ray 3.2 en el 93% de los casos, a Runway Gen-4.5 en el 77%, a Grok Imagine Video hasta en un 69%, a Kling v3 Pro en un 60%, a Happy Horse v1 en un 59% y a Happy Horse 1.1 en un 57%. Contra Seedance 2.0 y Gemini Omni Flash, el resultado fue del 52%. La predicción de vídeo consume más del 95% de los recursos computacionales de entrenamiento, mientras que el audio emplea menos del 0,5% de los tokens. La misma base se utiliza para FLUX-mimic, una política robótica que funciona en menos de 80 ms en una sola RTX 5090. El acceso es limitado: vídeo y acciones están en acceso temprano, las imágenes llegarán más tarde y los pesos abiertos serán lo último.
Fuente: MarkTechPost —
original
