La post-production vidéo en danger : MiniMax H3 transforme les dessins à la main en effets, le « moment codage » multimodal arrive
MiniMax
MiniMax publie son premier modèle vidéo open source, H3, qui intègre de bout en bout le montage, la typographie, les transitions, le rythme, la musique de fond et les effets visuels. Les utilisateurs peuvent saisir du texte et obtenir une vidéo prête à publier, avec une résolution 2K par défaut. Le modèle est salué comme un nouveau SOTA en matière de montage vidéo et prend en charge l'entrée multimodale complète, y compris le texte, les images, l'audio et la vidéo.
MiniMax a officiellement publié son modèle vidéo de nouvelle génération, MiniMAX H3, qui est également son premier modèle vidéo open source. H3 brise le paradigme précédent où les modèles vidéo ne généraient que des séquences brutes, en intégrant de bout en bout la logique de montage, la typographie, la conception des transitions, le contrôle du rythme, la musique de fond et les effets visuels. Les utilisateurs peuvent saisir du texte et recevoir une vidéo finalisée prête à être publiée, avec une résolution 2K par défaut. Le modèle a été bien accueilli par les développeurs à l'étranger et a dominé le classement Artificial Analysis pour l'édition vidéo. L'auteur a testé H3 et a constaté qu'il répond très bien à l'intention de l'utilisateur, en suivant même des instructions complexes multi-plans avec précision. H3 démontre également une amélioration significative dans la génération de texte dans les vidéos, ce qui était un point de défaillance courant pour les modèles vidéo IA. Il peut générer du texte qui reste cohérent entre les plans et comprend même la relation entre le texte et le contenu visuel. De plus, H3 peut prendre un clip audio en entrée pour le dialogue, avec une voix synchronisée sur l'émotion et le rythme des visuels, s'appuyant sur l'expertise de MiniMax dans les modèles vocaux multimodaux. Le prix est bas, avec un coût par seconde en résolution 2K inférieur à un tiers de celui des modèles grand public. H3 prend en charge l'entrée multimodale complète, ce qui signifie que tous les types de médias font partie du contexte du modèle. Il utilise un modèle de légende personnalisé et une architecture de transformateur H3-Omni pour un traitement multimodal efficace. L'approche de MiniMax repose sur l'émergence du multimodal plus langage, reliant des modalités isolées par le langage. La nature open source de H3 permet aux entreprises de déployer et d'affiner le modèle en privé pour des flux de travail de contenu personnalisés, ce qui pourrait conduire à une explosion de vitalité de la propriété intellectuelle. MiniMax a une histoire de modèles open source, de la série M2 à maintenant H3, en accord avec sa vision de « Intelligence avec tout le monde ». Cette sortie marque un changement où la génération vidéo entre dans un « moment de codage », devenant un outil de production commercialement viable.
Source: QbitAI 量子位 —
original
