⚡ ÚLTIMA HORA
ModelosGeração de Mídia 🇺🇸 26.07.2026 21:02

Black Forest Labs lança FLUX 3: modelo multimodal para imagens, vídeo, áudio e previsão de ações robóticas

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
A Black Forest Labs (BFL) apresenta o FLUX 3, um modelo fundacional multimodal treinado conjuntamente em imagens, vídeo, áudio e previsão de ações robóticas. O modelo utiliza a arquitetura Self-Flow para alinhar modalidades, e testes iniciais mostram forte preferência sobre concorrentes como Luma Ray 3.2 e Runway Gen-4.5 na geração de texto para vídeo.
A Black Forest Labs (BFL) lançou o FLUX 3, um modelo fundacional multimodal que aprende a partir de imagens, vídeos e áudio dentro de uma única arquitetura. É o primeiro modelo FLUX a fornecer previsão de vídeo, áudio e ação a partir de um conjunto de pesos. A equipe de pesquisa argumenta que nenhuma modalidade isolada oferece uma descrição completa do mundo, e treinar em todas elas ao mesmo tempo faz com que as modalidades se restrinjam mutuamente. O FLUX 3 baseia-se no Self-Flow, método da BFL para alinhar geração e compreensão multimodal, que combina o objetivo de correspondência de fluxo com um objetivo de reconstrução de características auto-supervisionado. O FLUX 3 Video gera clipes de até 20 segundos em uma única geração com áudio nativo, suportando texto-para-vídeo, imagem-para-vídeo, vídeo-para-vídeo, quadro-chave-para-vídeo e continuação generativa de vídeo e áudio. A BFL relata desempenho robusto em expressões faciais humanas e na associação de sons a eventos físicos. Em testes preliminares de preferência humana para clipes de texto-para-vídeo de 10 segundos a 720p com áudio, o FLUX 3 foi preferido em relação ao Luma Ray 3.2 em 93% das comparações, ao Runway Gen-4.5 em 77%, ao Grok Imagine Video em 69%, ao Kling v3 Pro em 60%, e ao Happy Horse v1 e 1.1 em 59% e 57%, respectivamente. Contra o Seedance 2.0 e o Gemini Omni Flash, alcançou 52%. A previsão de vídeo consome mais de 95% do poder computacional de treinamento, enquanto o áudio utiliza menos de 0,5% dos tokens. O mesmo backbone executa o FLUX-mimic, uma política de robô com menos de 80 ms em uma RTX 5090. O acesso é controlado: Vídeo e Ação estão em acesso antecipado, Imagem vem em seguida, e os pesos abertos por último.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas