モデルメディア生成 🇨🇳 31.07.2026 13:01

動画ポストプロダクションに危機:MiniMax H3が手書きをエフェクトに変える、マルチモーダルの「コーディングの瞬間」が到来

MiniMaxMiniMax
MiniMaxは、編集、タイポグラフィ、トランジション、テンポ、背景音楽、視覚効果をエンドツーエンドで統合した初のオープンソース動画モデルH3をリリースしました。ユーザーはテキストを入力するだけで、デフォルトで2K解像度の公開可能な動画を生成できます。このモデルは、動画編集における新しいSOTAとして賞賛され、テキスト、画像、音声、動画を含むフルモーダル入力をサポートしています。
MiniMaxは、次世代ビデオモデル「MiniMax H3」を正式にリリースしました。これは同社初のオープンソースビデオモデルでもあります。H3は、ビデオモデルが単に生の映像を生成するだけだった従来のパラダイムを打ち破り、編集ロジック、タイポグラフィ、トランジションのデザイン、リズムコントロール、背景音楽、視覚効果をエンドツーエンドで統合しています。ユーザーはテキストを入力するだけで、公開可能な完成済みビデオをデフォルトの2K解像度で受け取ることができます。このモデルは海外の開発者から高い評価を受け、Artificial Analysisのリーダーボードでビデオ編集部門のトップに輝きました。著者がH3をテストしたところ、ユーザーの意図に非常に敏感で、複雑なマルチショットのプロンプトにも正確に従うことが確認されました。また、H3は、AIビデオモデルが共通して苦手としていた、ビデオ内でのテキスト生成の精度も大幅に向上しています。フレーム間で一貫性のあるテキストを生成できるだけでなく、テキストと視覚コンテンツの関係性を理解することもできます。さらに、H3は音声クリップを入力として対話に使用でき、音声が映像の感情やリズムに同期します。これはMiniMaxのマルチモーダル音声モデルにおける専門知識を基盤としています。価格は低く、2K解像度での1秒あたりのコストは主流モデルの3分の1未満です。H3はフルモーダル入力をサポートしており、あらゆる種類のメディアがモデルのコンテキストの一部となります。独自のキャプションモデルとH3-Omni Transformerアーキテクチャを使用して、効率的なマルチモーダル処理を実現しています。MiniMaxのアプローチは、マルチモーダルと言語の創発に基づいており、言語を通じて孤立したモダリティを接続します。H3のオープンソース化により、企業はカスタムコンテンツワークフローのためにモデルをプライベートに展開し、ファインチューニングすることが可能になり、知的財産の活力が爆発的に高まる可能性があります。MiniMaxは、M2シリーズから今回のH3まで、モデルをオープンソース化してきた歴史があり、「Intelligence with Everyone」というビジョンと一致しています。今回のリリースは、ビデオ生成が商業的に利用可能なプロダクションツールとなる「コーディングの瞬間」への移行を示しています。
出典: QbitAI 量子位 — 原文
関連記事 ↓
新着ニュース