ModèlesGénération Média 🇺🇸 26.07.2026 21:02

Black Forest Labs dévoile FLUX 3 : un modèle multimodal pour images, vidéo, audio et prédiction d'actions robotiques

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
Black Forest Labs (BFL) a présenté FLUX 3, un modèle fondamental multimodal entraîné sur des images, des vidéos et de l'audio au sein d'une architecture unique. Le modèle génère des vidéos jusqu'à 20 secondes avec un son synchronisé et obtient des résultats élevés en matière de préférence des utilisateurs, surpassant Luma Ray 3.2 dans 93% des cas et Runway Gen-4.5 dans 77% des cas.
La société Black Forest Labs (BFL) a lancé FLUX 3, un modèle fondamental multimodal qui s'entraîne sur des images, des vidéos et de l'audio dans une architecture unifiée. Il s'agit du premier modèle FLUX capable de générer des vidéos, de l'audio et de prédire des actions à partir d'un seul ensemble de poids. Les chercheurs de BFL affirment qu'aucune modalité unique ne fournit une description complète du monde : les images capturent la structure spatiale à un instant donné, la vidéo rétablit le temps et révèle la dynamique physique, l'audio met en évidence les relations de cause à effet entre les événements mécaniques et le son. L'entraînement simultané sur toutes les modalités les oblige à se contraindre mutuellement : le son doit correspondre à une collision, le mouvement doit obéir à la masse. Au cœur du modèle se trouve la méthode Self-Flow, qui combine un objectif d'alignement de flux avec un objectif de reconstruction de caractéristiques auto-adaptatif. L'implémentation de référence sur GitHub (ImageNet 256×256) utilise SiT-XL/2 avec conditionnement temporel image par image, un masque de 25 % et une auto-distillation d'un enseignant EMA au niveau 20 vers un élève au niveau 8. Pour FLUX 3, BFL a considérablement augmenté les ressources de calcul et de données, en entraînant le modèle simultanément sur des vidéos, des images et de l'audio. FLUX 3 Video génère des clips allant jusqu'à 20 secondes en un seul passage avec un audio natif, et prend en charge les modes text-to-video, image-to-video, video-to-video, keyframe-to-video, ainsi que la prolongation générative vidéo-audio. BFL souligne également les capacités de dialogue multilingue, de montage agentique de clips en séquences multi-scènes et la génération de typographie de qualité avec animation. Le modèle est particulièrement performant dans la génération d'expressions faciales humaines et l'association de sons avec des événements physiques. Dans des tests de préférence utilisateur préliminaires, FLUX 3 a battu Luma Ray 3.2 dans 93 % des cas, Runway Gen-4.5 dans 77 %, Grok Imagine Video jusqu'à 69 %, Kling v3 Pro 60 %, Happy Horse v1 59 % et Happy Horse 1.1 57 %. Contre Seedance 2.0 et Gemini Omni Flash, le résultat était de 52 %. La prédiction vidéo consomme plus de 95 % des ressources de calcul d'entraînement, tandis que l'audio consomme moins de 0,5 % des tokens. La même base est utilisée pour FLUX-mimic, une politique robotique fonctionnant en moins de 80 ms sur un seul RTX 5090. L'accès est limité : vidéo et actions en accès anticipé, images plus tard, poids ouverts en dernier.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches