MiniMax H3:自ら演出し、音声を生成し、編集も行うニューラルネットワーク
MiniMaxは、H3(Hailuo 3.0としても知られる)をリリースしました。これは、同期したオーディオを生成する動画、参照動画に従った編集、さらにはグリーンスクリーン除去まで処理するマルチモーダルAIモデルです。このモデルはライセンスの下でオープンソース化されており、ウェイトはHugging Faceで入手でき、API経由で最大2K解像度をサポートします。テキスト、画像、動画、音声の処理を1つのコンテキストに統合することを目指しています。
MiniMaxは、Hailuo 3.0またはHailuo 03としてもブランド化されているH3を発表しました。これは、24fpsで4〜15秒のビデオをネイティブのステレオオーディオ(32kHz)付きで生成でき、API経由では最大2K解像度、セルフホスト時は768pに対応するマルチモーダルモデルです。このモデルは、最大9枚の参照画像、3本のビデオ、3つのオーディオファイルを同時に受け取ることができ、参照クリップのタイミングとスタイルに合わせてビデオを編集することもできます。また、グリーンスクリーン除去や照明調整も行えます。アーキテクチャは、ソースを言語記述に圧縮し(約10万トークンを4千トークンに削減)、再設計されたVAEトーカナイザーを使用して実効シーケンス長を4倍に拡大し、理解と生成のための計算を分離しています。MiniMaxは、2026年7月31日のAPI公開から数日後の2026年8月2日から3日にかけて、モデルの重みをHugging Faceで公開しました。デモでは、編集、広告、シームレスなトランジションなどの複雑なプロンプトを処理する様子が示されていますが、生成ビデオモデルに共通する弱点である、ビデオ上の小さなテキストの扱いには依然として苦戦しています。
出典: Habr — хаб ИИ —
原文
