MiniMax H3, 오픈 비디오 모델 최초로 비디오 편집 순위 1위에 오르다
MiniMax
ByteDance
MiniMax가 비디오 모델 H3의 가중치를 공개하면서, 오픈 모델로는 처음으로 비디오 순위에서 최상위를 차지했습니다. Artificial Analysis에 따르면, H3는 비디오 편집 부문 1위, 텍스트-투-비디오 부문 2위, 이미지-투-비디오 부문 3위를 기록했습니다. 330억 개의 파라미터를 가진 이 모델은 텍스트, 이미지, 비디오, 오디오를 통합 처리하며 스테레오 사운드를 포함한 클립을 생성하지만, 일부 구성 요소는 여전히 비공개 상태로 남아 있습니다.
MiniMax이 비디오 모델 H3의 가중치를 공개했다. 오픈 모델이 비디오 순위에서 1위를 차지한 것은 이번이 처음이다. Artificial Analysis에서 H3는 비디오 편집 부문 1위, 텍스트-투-비디오 부문 2위, 이미지-투-비디오 부문 3위를 기록했다. 330억 개의 매개변수를 가진 이 모델은 텍스트, 이미지, 비디오, 오디오를 함께 처리하여 4초에서 15초 길이의 클립을 스테레오 사운드와 함께 생성한다. 모델 카드에 따르면 프롬프트당 최대 9개의 참조 이미지, 3개의 비디오 클립, 3개의 오디오 클립을 처리할 수 있다. 그러나 두 가지 구성 요소는 여전히 비공개 상태다. 2K 해상도 모듈과 프롬프트 및 참조 자료를 구조화된 중간 형태로 변환하는 H3-Context-IR이 그것이다. ComfyUI에서 로컬로 실행하면 768p 출력이 생성되지만, 컨텍스트 처리는 공개된 프롬프트 가이드를 사용하여 재현할 수 있다. 오픈 가중치를 통해 자체 영상, 캐릭터 또는 일관된 스타일 등으로 파인튜닝할 수 있다. 다만 라이선스는 연간 매출 2천만 달러 미만인 기업에만 상업적 사용을 허용한다. 동시에 ByteDance는 30초 클립을 오디오와 함께 제공하는 폐쇄형 Seedance 2.5를 출시했다.
출처: The Decoder (DE) —
원문
