MiniMax H3: A Rede Neural que Dirige, Faz Som e Edita a Si Mesma
A MiniMax lançou o H3 (também conhecido como Hailuo 3.0), um modelo de IA multimodal que gera vídeo com áudio sincronizado, realiza edições seguindo vídeos de referência e até lida com remoção de tela verde. O modelo é de código aberto sob uma licença, com pesos disponíveis no Hugging Face, e suporta resolução de até 2K via API. Ele visa unificar o processamento de texto, imagem, vídeo e áudio em um único contexto.
A MiniMax lançou o H3, também conhecido como Hailuo 3.0 ou Hailuo 03, um modelo multimodal capaz de gerar vídeos de 4 a 15 segundos a 24 fps com áudio estéreo nativo a 32 kHz e resolução de até 2K via API, ou 768p quando auto-hospedado. O modelo pode receber até 9 imagens de referência, 3 vídeos e 3 arquivos de áudio simultaneamente, e pode editar vídeos para que correspondam ao ritmo e estilo de um clipe de referência. Ele também remove fundos verdes e ajusta a iluminação. A arquitetura comprime fontes em descrições de linguagem (reduzindo cerca de 100 mil tokens para 4 mil), utiliza um tokenizador VAE reprojetado com um aumento de quatro vezes no comprimento efetivo da sequência e inclui computações separadas para compreensão e geração. A MiniMax disponibilizou os pesos do modelo no Hugging Face em 2 e 3 de agosto de 2026, vários dias após o lançamento da API em 31 de julho de 2026. Demonstrações mostram o modelo lidando com prompts complexos para edição, publicidade e transições suaves, mas ele ainda apresenta dificuldades com texto pequeno em vídeos, uma fraqueza comum em modelos generativos de vídeo.
Fonte: Habr — хаб ИИ —
original
