모델미디어 생성 🇨🇳 31.07.2026 13:01

비디오 후반 작업이 위협받는다: MiniMax H3, 손그림을 이펙트로 만드는 멀티모달의 '코딩 순간' 도래

MiniMaxMiniMax
MiniMax가 최초의 오픈소스 비디오 모델 H3를 공개했습니다. 이 모델은 편집, 타이포그래피, 전환, 페이스 조절, 배경 음악, 시각 효과를 엔드 투 엔드로 통합합니다. 사용자는 텍스트를 입력하면 기본적으로 2K 해상도의 바로 게시 가능한 비디오를 얻을 수 있습니다. 이 모델은 비디오 편집 분야의 새로운 SOTA(최고 수준)로 평가되며, 텍스트, 이미지, 오디오, 비디오를 포함한 전체 모달 입력을 지원합니다.
MiniMax가 공식적으로 차세대 비디오 모델인 MiniMax H3를 출시했으며, 이는 회사의 첫 오픈소스 비디오 모델이기도 합니다. H3는 비디오 모델이 단순히 원본 영상만 생성하던 기존 패러다임을 깨고, 편집 로직, 타이포그래피, 전환 디자인, 리듬 제어, 배경 음악, 시각 효과를 엔드투엔드로 통합합니다. 사용자는 텍스트를 입력하면 바로 게시할 수 있는 완성된 비디오를 받을 수 있으며, 기본 해상도는 2K입니다. 이 모델은 해외 개발자들에게 좋은 반응을 얻었으며, Artificial Analysis의 비디오 편집 리더보드에서 1위를 차지했습니다. 저자는 H3를 테스트해 보았고, 사용자의 의도를 매우 잘 반영하며 복잡한 멀티샷 프롬프트도 정확히 따르는 것을 확인했습니다. H3는 또한 AI 비디오 모델의 공통적인 실패 지점이었던 비디오 내 텍스트 생성에서도 큰 개선을 보여줍니다. 프레임 간에 일관된 텍스트를 생성할 수 있을 뿐만 아니라 텍스트와 시각 콘텐츠 간의 관계까지 이해합니다. 또한 H3는 오디오 클립을 입력으로 받아 대화를 생성할 수 있으며, 음성은 비주얼의 감정과 리듬에 맞춰 동기화됩니다. 이는 MiniMax의 멀티모달 음성 모델 전문성을 기반으로 합니다. 가격은 저렴하며, 2K 해상도에서 초당 비용은 주류 모델의 3분의 1 미만입니다. H3는 전체 모달 입력을 지원하며, 즉 모든 유형의 미디어가 모델의 컨텍스트의 일부가 됩니다. 맞춤형 캡션 모델과 H3-Omni Transformer 아키텍처를 사용하여 효율적인 멀티모달 처리를 수행합니다. MiniMax의 접근 방식은 멀티모달과 언어의 융합에서 나온 것으로, 언어를 통해 분리된 모달리티를 연결합니다. H3의 오픈소스 특성 덕분에 기업은 맞춤형 콘텐츠 워크플로우를 위해 모델을 비공개로 배포하고 미세 조정할 수 있으며, 이는 지적 재산의 폭발적인 성장으로 이어질 수 있습니다. MiniMax는 M2 시리즈부터 현재 H3까지 모델을 오픈소스로 공개해 온 역사가 있으며, 이는 '모두를 위한 지능'이라는 비전과 일치합니다. 이번 출시는 비디오 생성이 '코딩의 순간'으로 전환되어 상업적으로 실행 가능한 제작 도구가 되었음을 의미합니다.
출처: QbitAI 量子位 — 원문
관련 게시물 ↓
새로운 뉴스