Black Forest Labs 发布 FLUX 3:面向图像、视频、音频和机器人动作预测的多模态模型
Luma AI
Runway
xAI
Google/DeepMind
Black Forest Labs (BFL) 推出了 FLUX 3,这是一个在单一架构中基于图像、视频和音频训练的多模态基础模型。该模型可生成长达 20 秒的同步音频视频,并取得了很高的用户偏好结果,在 93% 的案例中超越了 Luma Ray 3.2,在 77% 的案例中超越了 Runway Gen-4.5。
Black Forest Labs (BFL) 团队发布了 FLUX 3——一种多模态基础模型,能在统一架构中同时学习图像、视频和音频。这是首款 FLUX 模型,能够从同一组权重中生成视频、音频并预测动作。BFL 的研究人员指出,单一模态无法完整描述世界:图像捕捉某一时刻的空间结构,视频恢复时间并揭示物理动态,音频则揭示机械事件与声音之间的因果关系。同时对所有模态进行训练,迫使它们相互制约——声音必须与碰撞匹配,运动必须遵循质量。该模型的核心是 Self-Flow 方法,它结合了流匹配目标与自适应的特征重建目标。GitHub 上的参考实现(ImageNet 256×256)使用了 SiT-XL/2,并采用帧级时间条件、25% 的掩码率,以及通过 EMA 教师模型在第 20 层向第 8 层的学生模型进行自蒸馏。对于 FLUX 3,BFL 大幅增加了计算和数据处理资源,同时对视频、图像和音频进行训练。FLUX 3 Video 能够一次性生成长达 20 秒的片段,并自带原生音频,支持文生视频、图生视频、视频转视频、关键帧转视频以及视频-音频的生成式延续。BFL 还强调了多语言对话、将片段智能组装成多场景序列,以及生成带动画的高质量字体的能力。该模型在生成人类面部表情以及将声音与物理事件相关联方面尤为出色。在初步用户偏好测试中,FLUX 3 在 93% 的情况下击败了 Luma Ray 3.2,77% 击败 Runway Gen-4.5,最高 69% 击败 Grok Imagine Video,60% 击败 Kling v3 Pro,59% 击败 Happy Horse v1,57% 击败 Happy Horse 1.1。对比 Seedance 2.0 和 Gemini Omni Flash 的结果为 52%。视频预测消耗了超过 95% 的训练计算资源,音频则消耗不到 0.5% 的 token。相同的框架也被用于 FLUX-mimic——一种机器人策略,在单个 RTX 5090 上运行时间低于 80 毫秒。访问受到限制:视频和动作处于早期访问阶段,图像稍后推出,开放权重则最后提供。
来源: MarkTechPost —
原文
