ComfyUI APIでエンドツーエンドのMiniMax-H3動画・音声生成パイプラインを構築
ComfyUI
Hugging Face
このチュートリアルでは、ComfyUIをヘッドレス推論バックエンドとして使用し、エンドツーエンドのMiniMax-H3動画生成ワークフローを実装する方法を説明します。環境設定、Hugging Faceからのモデル重みの自動ダウンロード、スキーマ認識グラフ構築、動画・音声のジョイントデコード、複数の生成モードについて、グラフィカルインターフェースなしで解説します。
このワークフローはComfyUIをプログラム的にセットアップし、GPUメモリ、ディスク容量、モデル精度、解像度、長さ、サンプリング、生成モードを設定します。ハードウェアの能力に基づいて、重みプロファイルを動的に選択します。必要な拡散、テキストエンコーダー、ビデオVAE、オーディオVAEの重みはHugging Faceからダウンロードされ、サーバーはHTTPおよびWebSocket APIを介して通信します。実行グラフはPythonで構築され、/object_infoに対してノードスキーマを検証します。サポートされるモードには、テキストからビデオへの変換、最初と最後のフレーム条件付き生成、参照画像条件付き生成が含まれます。パイプラインは、自動モデルセットアップ、スキーマ認識グラフ構築、ビデオとオーディオの統合デコード、進捗モニタリング、出力収集を統合します。
出典: MarkTechPost —
原文
