Создание сквозного конвейера генерации видео и аудио MiniMax-H3 с помощью API ComfyUI
В руководстве описывается реализация сквозного рабочего процесса генерации видео MiniMax-H3 с использованием ComfyUI в качестве фонового сервера вывода. Рассматриваются настройка среды, автоматическая загрузка весов моделей с Hugging Face, построение графа с учетом схемы, совместное декодирование видео и аудио, а также несколько режимов генерации — всё без графического интерфейса.
Данный рабочий процесс настраивает ComfyUI программным способом, конфигурируя память GPU, емкость диска, точность моделей, разрешение, длительность, сэмплирование и режимы генерации. Он динамически выбирает профиль весов на основе аппаратных возможностей. Необходимые веса для диффузионной модели, текстового энкодера, видео-VAE и аудио-VAE загружаются с Hugging Face, а сервер взаимодействует через
Показать ещё ↓
Источник: MarkTechPost —
оригинал
