⚡ 速報
Black Forest LabsがFLUX 3をリリース:画像、動画、音声、ロボット行動予測のマルチモーダルモデル
Luma AI
Runway
xAI
Google/DeepMind
Black Forest Labs(BFL)は、画像、動画、音声、ロボット行動予測を共同で学習したマルチモーダル基盤モデルFLUX 3を発表しました。このモデルはSelf-Flowアーキテクチャを採用し、モダリティ間の調整を行います。初期テストでは、テキストから動画生成においてLuma Ray 3.2やRunway Gen-4.5といった競合モデルよりも強い好まれを示しています。
Black Forest Labs(BFL)は、画像、動画、音声を単一のアーキテクチャ内で学習するマルチモーダル基盤モデル「FLUX 3」をリリースしました。これは、一組の重みから動画、音声、動作予測を出力する初のFLUXモデルです。研究チームは、単一のモダリティ(様式)では世界を完全に記述できず、すべてを同時に学習することでモダリティ同士が制約し合うと主張しています。FLUX 3は、フローマッチング目的と自己教師あり特徴再構成目的を組み合わせた、BFLのマルチモーダル生成・理解のための手法「Self-Flow」を基盤としています。FLUX 3 Videoは、ネイティブ音声付きで最大20秒のクリップを1回の生成で作成し、テキストから動画、画像から動画、動画から動画、キーフレームから動画、生成動画・音声の継続をサポートします。BFLは、人間の表情や音と物理的イベントの関連付けにおいて優れた性能を報告しています。10秒、720p、音声付きのテキストから動画クリップに対する予備的な人間選好テストでは、FLUX 3はLuma Ray 3.2に対して93%、Runway Gen-4.5に対して77%、Grok Imagine Videoに対して69%、Kling v3 Proに対して60%、Happy Horse v1および1.1に対してそれぞれ59%および57%で選好されました。Seedance 2.0およびGemini Omni Flashに対しては52%でした。動画予測がトレーニング計算量の95%以上を消費し、音声はトークンの0.5%未満です。同じバックボーンが、1台のRTX 5090上で80ミリ秒未満のロボットポリシー「FLUX-mimic」を実行します。アクセスは段階的で、動画とアクションは早期アクセス、画像はその後、オープンウェイトは最後となります。
出典: MarkTechPost —
原文
