ModelosGeração de Mídia 🇺🇸 26.07.2026 21:02

Black Forest Labs lança FLUX 3: modelo multimodal para imagens, vídeo, áudio e previsão de ações robóticas

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
A Black Forest Labs (BFL) apresentou o FLUX 3, um modelo fundamental multimodal treinado em imagens, vídeo e áudio dentro de uma única arquitetura. O modelo gera vídeos de até 20 segundos com áudio sincronizado e alcança altos resultados de preferência do usuário, superando o Luma Ray 3.2 em 93% dos casos e o Runway Gen-4.5 em 77%.
A Black Forest Labs (BFL) lançou o FLUX 3, um modelo fundamental multimodal que é treinado em imagens, vídeos e áudio em uma arquitetura unificada. Este é o primeiro modelo FLUX capaz de gerar vídeo, áudio e prever ações a partir de um único conjunto de pesos. Os pesquisadores da BFL afirmam que nenhuma modalidade isolada oferece uma descrição completa do mundo: imagens capturam estrutura espacial em um instante, vídeos restauram o tempo e revelam dinâmica física, e áudio revela relações causais entre eventos mecânicos e som. O treinamento em todas as modalidades simultaneamente as força a se restringirem mutuamente — o som deve corresponder à colisão, o movimento deve obedecer à massa. No centro do modelo está o método Self-Flow, que combina o objetivo de alinhamento de fluxo com um objetivo de reconstrução de características autoajustável. A implementação de referência no GitHub (ImageNet 256×256) utiliza SiT-XL/2 com condicionamento temporal quadro a quadro, máscara de 25% e autodestilação de um professor EMA na camada 20 para um aluno na camada 8. Para o FLUX 3, a BFL aumentou significativamente os recursos computacionais e de dados, treinando o modelo simultaneamente em vídeo, imagens e áudio. O FLUX 3 Video gera clipes de até 20 segundos em uma única passagem com áudio nativo, suporta os modos text-to-video, image-to-video, video-to-video, keyframe-to-video e continuação generativa de vídeo-áudio. A BFL também destaca capacidades de diálogo multilíngue, montagem agêntica de clipes em sequências de múltiplas cenas e geração de tipografia de qualidade com animação. O modelo é particularmente forte na geração de expressões faciais humanas e na associação de sons a eventos físicos. Em testes preliminares de preferência do usuário, o FLUX 3 venceu o Luma Ray 3.2 em 93% dos casos, o Runway Gen-4.5 em 77%, o Grok Imagine Video em até 69%, o Kling v3 Pro em 60%, o Happy Horse v1 em 59% e o Happy Horse 1.1 em 57%. Contra o Seedance 2.0 e o Gemini Omni Flash, o resultado foi de 52%. A previsão de vídeo consome mais de 95% dos recursos computacionais de treinamento, enquanto o áudio consome menos de 0,5% dos tokens. A mesma base é usada para o FLUX-mimic, uma política de robô que opera em menos de 80 ms em uma única RTX 5090. O acesso é limitado: vídeo e ações estão em acesso antecipado, imagens virão depois, e os pesos abertos por último.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas