MiniMax, MiniMax H3 출시: 네이티브 스테레오 오디오로 15초 2K 클립을 생성하는 옴니-모달 비디오 모델
MiniMax
Google/DeepMind
ByteDance
MiniMax가 텍스트, 이미지, 비디오, 오디오 처리를 통합하는 범용 멀티모달 생성 모델인 MiniMax H3를 공개했습니다. 이 모델은 네이티브 스테레오 사운드와 함께 2K 비디오를 출력합니다. API와 Hailuo AI 앱을 통해 제공되며, 곧 오픈 웨이트를 제공할 예정입니다. 공격적으로 책정된 가격으로, H3는 비디오 편집에서 선두를 달리지만 다른 벤치마크에서는 경쟁사에 뒤처집니다.
MiniMax가 MiniMax H3를 출시했다. 이는 텍스트, 이미지, 비디오, 오디오를 통합된 컨텍스트로 읽고, 네이티브 스테레오 오디오가 포함된 비디오를 반환하는 범용 멀티모달 생성 모델로, 2K 해상도와 4초에서 15초(정수만)의 길이를 지원한다. 텍스트-비디오, 이미지-비디오 등 각각의 작업에 별도 모델을 요구했던 기존 스택과 달리, H3는 이러한 작업들을 단일 사전학습 패러다임에 통합하여, 비디오에서 카메라 움직임을 참조하거나 오디오에 보컬을 맞추는 등의 관계를 자연어로 표현한다. 이 모델은 2026년 7월 31일에 출시되었으며, 모델 ID MiniMax-H3로 API를 통해 제공되고, 소비자용 앱 Hailuo AI에서도 사용할 수 있다. 광고, 브랜딩, 전자상거래, 제품 디자인, UI/UX, 게임, 영화 사전 시각화, 리테일 카탈로그 미디어를 대상으로 하며, 광고 변형, 제품 비디오, 애니메이션 포스터, 비디오-비디오 모션 전송 등의 응용 분야를 포함한다. API는 텍스트-비디오, 첫/마지막 프레임 이미지-비디오, 참조 생성의 세 가지 입력 모드를 지원하며, 입력 제한에는 참조 이미지 최대 9개, 참조 비디오 최대 3개(각 2-15초, 총 15초 이하), 참조 오디오 클립 최대 3개(오디오는 이미지/비디오 동반 필요)가 포함된다. 혼합 입력은 최대 12개 파일로 제한되며, 프롬프트는 7000자 이하, 요청 본문은 64MB 이하, 파일 크기는 비디오 50MB 이하, 이미지 30MB 이하, 오디오 15MB 이하이다. 포맷은 H.264/H.265 비디오, JPG/PNG/WEBP/HEIC/HEIF 이미지, WAV/MP3 오디오를 포함한다. 네 가지 기술 구성 요소가 성능을 가능하게 한다: Contextual Omni Representation(관계를 설명하는 캡셔닝으로 약 10만 토큰을 약 4천 토큰으로 증류), H3-VAE(4배의 효과적인 시퀀스 길이 이득을 제공하는 토크나이저로 네이티브 2K 지원), H3-Omni Transformer(이해와 생성 작업을 분리하여 훈련 처리량을 약 30% 향상), In-Context Regeneration(기본 모델이 저해상도 출력을 인컨텍스트로 재생성하여 초고해상도 기술을 추가로 사용하지 않음). 가격 주장: 2K에서 초당 가격은 주류 모델의 3분의 1 미만이며, 768p에서는 주류 720p의 절반 미만이다. 제3자 트래커는 초당 0.13달러(15초 클립당 약 1.95달러)를 보고하지만, MiniMax의 종량제 페이지에는 여전히 Hailuo 2.3 계층이 나열되어 있다. SCMP가 Artificial Analysis를 인용한 바에 따르면, H3는 비디오 편집에서 선두를 달리고, 텍스트-비디오에서는 Google의 Gemini Omni Flash에 뒤처지며, 이미지-비디오에서는 Seedance 2.0과 Gemini Omni Flash 뒤에 있다. 오픈 웨이트는 '곧' 제공될 예정이지만 아직 출시되지 않았다.
출처: MarkTechPost —
원문
