MiniMax Lança MiniMax H3: Modelo de Vídeo Omni-Modal que Gera Clipes de 2K com 15 Segundos e Áudio Estéreo Nativo
MiniMax
Google/DeepMind
ByteDance
A MiniMax revelou o MiniMax H3, um modelo de geração multimodal de uso geral que unifica o processamento de texto, imagem, vídeo e áudio, produzindo vídeo em 2K com som estéreo nativo. O modelo está disponível via API e no aplicativo Hailuo AI, com pesos abertos prometidos em breve. Com preço agressivo, o H3 lidera em edição de vídeo, mas fica atrás dos rivais em outros benchmarks.
A MiniMax lançou o MiniMax H3, um modelo multimodal de geração de uso geral que lê texto, imagens, vídeo e áudio como um contexto unificado e retorna vídeo com áudio estéreo nativo, suportando resolução 2K, durações de 4 a 15 segundos (apenas inteiros). Ao contrário das pilhas anteriores que exigiam modelos separados para texto para vídeo, imagem para vídeo e outras tarefas, o H3 incorpora tudo isso em um único paradigma de pré-treinamento, onde as relações são expressas em linguagem natural, como referenciar movimento de câmera de um vídeo ou combinar vocais com áudio. O modelo foi lançado em 31 de julho de 2026, disponível via API sob o ID de modelo MiniMax-H3 e no aplicativo de consumo Hailuo AI. Ele é posicionado para publicidade, branding, comércio eletrônico, design de produto, UI/UX, jogos, pré-visualização de filmes e mídia de catálogo de varejo, com aplicações que incluem variações de anúncios, vídeos de produto, pôsteres animados e transferência de movimento de vídeo para vídeo. A API suporta três modos de entrada—texto para vídeo, imagem para vídeo de primeiro/último quadro e geração por referência—com limites de entrada incluindo até 9 imagens de referência, 3 vídeos de referência (2 a 15 segundos cada, ≤15 segundos no total) e 3 clipes de áudio de referência (áudio requer imagem/vídeo acompanhante). O limite de entrada mista é de 12 arquivos; prompts ≤7.000 caracteres; corpo de solicitação ≤64 MB; tamanhos de arquivo: vídeo ≤50 MB, imagem ≤30 MB, áudio ≤15 MB. Os formatos incluem vídeo H.264/H.265, imagens JPG/PNG/WEBP/HEIC/HEIF e áudio WAV/MP3. Quatro componentes técnicos permitem seu desempenho: Contextual Omni Representation (legenda que descreve relações, destilando ~100 mil tokens para ~4 mil), H3-VAE (um tokenizador com ganho de comprimento de sequência efetivo de 4× que permite 2K nativo), H3-Omni Transformer (separa cargas de trabalho de compreensão e geração, aumentando o rendimento de treinamento em ~30%) e In-Context Regeneration (o modelo base regenera saída de baixa resolução no contexto, em vez de anexar super-resolução). Alegações de preço: a 2K, o preço por segundo é menos de um terço dos modelos mainstream; a 768p, menos da metade do mainstream 720p. Rastreadores de terceiros relatam US$ 0,13 por segundo (~US$ 1,95 por clipe de 15 segundos), mas a página de pagamento conforme o uso da MiniMax ainda lista os níveis do Hailuo 2.3. De acordo com o SCMP citando a Artificial Analysis, o H3 lidera em edição de vídeo, fica atrás do Google Gemini Omni Flash em texto para vídeo, e fica atrás do Seedance 2.0 e do Gemini Omni Flash em imagem para vídeo. Pesos abertos são prometidos 'nos próximos dias', mas ainda não foram lançados.
Fonte: MarkTechPost —
original
