ComfyUI API로 엔드투엔드 MiniMax-H3 비디오 및 오디오 생성 파이프라인 구축하기
ComfyUI
Hugging Face
이 튜토리얼은 ComfyUI를 헤드리스 추론 백엔드로 사용하여 엔드투엔드 MiniMax-H3 비디오 생성 워크플로우를 구현하는 방법을 설명합니다. 환경 설정, Hugging Face에서의 자동 모델 가중치 다운로드, 스키마 인지 그래프 구성, 비디오-오디오 공동 디코딩, 그리고 그래픽 인터페이스 없이 여러 생성 모드를 다룹니다.
이 워크플로우는 ComfyUI를 프로그래밍 방식으로 설정하여 GPU 메모리, 디스크 용량, 모델 정밀도, 해상도, 지속 시간, 샘플링 및 생성 모드를 구성합니다. 하드웨어 성능에 따라 가중치 프로필을 동적으로 선택합니다. 필요한 확산(diffusion), 텍스트 인코더(text-encoder), 비디오 VAE(video-VAE), 오디오 VAE(audio-VAE) 가중치는 Hugging Face에서 다운로드되며, 서버는 HTTP 및 WebSocket API를 통해 통신합니다. 실행 그래프는 Python으로 구축되며, /object_info에 대한 노드 스키마를 검증합니다. 지원되는 모드에는 텍스트-비디오, 첫 프레임 및 마지막 프레임 조건, 참조 이미지 조건 생성이 포함됩니다. 파이프라인은 자동 모델 설정, 스키마 인식 그래프 구축, 비디오-오디오 공동 디코딩, 진행 상황 모니터링 및 출력 수집을 통합합니다.
출처: MarkTechPost —
원문
