⚡ 突发新闻
模型媒体生成 🇺🇸 26.07.2026 21:02

Black Forest Labs 发布 FLUX 3:面向图像、视频、音频和机器人动作预测的多模态模型

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
Black Forest Labs(BFL)推出 FLUX 3,这是一个在图像、视频、音频和机器人动作预测上联合训练的多模态基础模型。该模型利用 Self-Flow 架构对齐模态,早期测试显示在文生视频生成中相比 Luma Ray 3.2 和 Runway Gen-4.5 等竞品具有显著偏好。
黑森林实验室(BFL)发布了FLUX 3,这是一个多模态基础模型,能在单一架构中学习图像、视频和音频。这是首个通过同一组权重输出视频、音频和动作预测的FLUX模型。研究团队认为,没有任何单一模态能完整描述世界,同时对所有模态进行训练意味着它们相互约束。FLUX 3基于Self-Flow——BFL的对齐多模态生成与理解的方法,它将流匹配目标与自监督特征重建目标相结合。FLUX 3视频可在单次生成中产出最长20秒的片段并自带原生音频,支持文生视频、图生视频、视频生视频、关键帧生视频以及生成式视频音频延续。BFL报告其在人类面部表情和将声音与物理事件关联方面表现强劲。在针对10秒、720p、带音频的文生视频片段的初步人类偏好测试中,FLUX 3优于Luma Ray 3.2(93%对比)、Runway Gen-4.5(77%)、Grok Imagine Video(69%)、Kling v3 Pro(60%),以及Happy Horse v1和1.1(分别为59%和57%)。对阵Seedance 2.0和Gemini Omni Flash时,其偏好率达到52%。视频预测消耗了超过95%的训练算力,音频则不到0.5%的令牌。相同的骨干网络运行FLUX-mimic——一种机器人策略,在一张RTX 5090上响应时间低于80毫秒。访问受限:视频和动作功能处于早期访问阶段,图像功能随后,开源权重最后推出。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻