Pós-produção de vídeo em risco: MiniMax H3 transforma desenhos à mão em efeitos, o 'momento de codificação' multimodal chega
MiniMax
A MiniMax lança seu primeiro modelo de vídeo de código aberto, H3, que integra edição, tipografia, transições, ritmo, música de fundo e efeitos visuais de ponta a ponta. Os usuários podem inserir texto e obter um vídeo pronto para publicação, com resolução 2K por padrão. O modelo é elogiado como um novo SOTA em edição de vídeo e suporta entrada multimodal completa, incluindo texto, imagens, áudio e vídeo.
A MiniMax lançou oficialmente seu modelo de vídeo de próxima geração, o MiniMax H3, que também é seu primeiro modelo de vídeo de código aberto. O H3 quebra o paradigma anterior em que os modelos de vídeo geravam apenas filmagens brutas, integrando lógica de edição, tipografia, design de transições, controle de ritmo, música de fundo e efeitos visuais de ponta a ponta. Os usuários podem inserir texto e receber um vídeo finalizado pronto para publicação, com resolução padrão de 2K. O modelo foi bem recebido por desenvolvedores no exterior e liderou o ranking da Artificial Analysis para edição de vídeo. O autor testou o H3 e descobriu que ele é altamente responsivo à intenção do usuário, seguindo até prompts complexos de múltiplas cenas com precisão. O H3 também demonstra uma melhora significativa na geração de texto em vídeos, que tem sido um ponto fraco comum nos modelos de vídeo com IA. Ele pode gerar texto que permanece consistente entre os quadros e até entende a relação entre texto e conteúdo visual. Além disso, o H3 pode receber um clipe de áudio como entrada para diálogo, com a voz sincronizada com a emoção e o ritmo das imagens, com base na expertise da MiniMax em modelos de voz multimodais. O preço é baixo, com o custo por segundo na resolução 2K sendo menos de um terço do preço dos modelos mainstream. O H3 suporta entrada multimodal completa, ou seja, todos os tipos de mídia fazem parte do contexto do modelo. Ele usa um modelo de legenda personalizado e uma arquitetura H3-Omni Transformer para processamento multimodal eficiente. A abordagem da MiniMax baseia-se na emergência do multimodal mais linguagem, conectando modalidades isoladas por meio da linguagem. A natureza de código aberto do H3 permite que empresas implantem e ajustem o modelo de forma privada para fluxos de trabalho de conteúdo personalizados, potencialmente levando a uma explosão de vitalidade de propriedade intelectual. A MiniMax tem um histórico de abrir o código de seus modelos, desde a série M2 até agora o H3, alinhando-se com sua visão de 'Inteligência para Todos'. O lançamento marca a mudança da geração de vídeo para um 'momento de codificação', onde ela se torna uma ferramenta de produção comercialmente viável.
Fonte: QbitAI 量子位 —
original
