미디어 생성모델 🇷🇺 06.08.2026 12:01

MiniMax H3: 직접 연출하고, 소리를 만들고, 스스로 편집하는 신경망

MiniMax가 H3(일명 Hailuo 3.0)를 출시했습니다. 이 멀티모달 AI 모델은 오디오가 동기화된 비디오를 생성하고, 참조 비디오를 따라 편집하며, 그린 스크린 제거까지 처리할 수 있습니다. 이 모델은 라이선스 하에 오픈소스로 공개되었으며, 가중치는 Hugging Face에서 확인할 수 있고, API를 통해 최대 2K 해상도를 지원합니다. 텍스트, 이미지, 비디오, 오디오 처리를 하나의 컨텍스트로 통합하는 것을 목표로 합니다.
MiniMax가 H3를 출시했는데, 이는 Hailuo 3.0 또는 Hailuo 03으로도 알려져 있습니다. 이 멀티모달 모델은 24fps에서 4~15초 분량의 비디오를 생성하며, 기본 스테레오 오디오를 32kHz로 지원하고, API를 통해 최대 2K 해상도, 자체 호스팅 시 768p 해상도를 제공합니다. 이 모델은 동시에 최대 9개의 참조 이미지, 3개의 비디오, 3개의 오디오 파일을 입력받을 수 있으며, 참조 클립의 타이밍과 스타일에 맞춰 비디오를 편집할 수도 있습니다. 또한 그린 스크린을 제거하고 조명을 조정할 수 있습니다. 아키텍처는 소스를 언어 설명으로 압축하여(약 100,000개의 토큰을 4,000개로 줄임), 재설계된 VAE 토크나이저를 사용하여 유효 시퀀스 길이를 4배로 늘렸으며, 이해와 생성을 위한 별도의 계산을 포함합니다. MiniMax는 2026년 7월 31일 API 출시 며칠 후인 2026년 8월 2~3일에 Hugging Face에 모델 가중치를 공개했습니다. 데모에서는 편집, 광고, 매끄러운 전환을 위한 복잡한 프롬프트를 처리하는 모습을 보여주지만, 생성형 비디오 모델의 일반적인 약점인 비디오 내 작은 텍스트 처리에는 여전히 어려움을 겪고 있습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스