MiniMax H3, premier modèle vidéo ouvert en tête du classement de montage vidéo
MiniMax
ByteDance
MiniMax a publié les poids de son modèle vidéo H3, devenant ainsi le premier modèle ouvert à atteindre la première place d'un classement vidéo. Selon Artificial Analysis, H3 se classe premier en montage vidéo, deuxième en texte-vers-vidéo et troisième en image-vers-vidéo. Le modèle de 33 milliards de paramètres traite conjointement le texte, les images, les vidéos et l'audio, générant des clips avec son stéréo, mais certains composants restent fermés.
MiniMax a rendu publics les poids de son modèle vidéo H3, marquant la première fois qu'un modèle ouvert se hisse en tête d'un classement vidéo. Sur Artificial Analysis, H3 se classe premier en montage vidéo, deuxième en texte-vers-vidéo et troisième en image-vers-vidéo. Le modèle à 33 milliards de paramètres traite conjointement le texte, les images, les vidéos et l'audio, produisant un clip de quatre à quinze secondes avec son stéréo, et selon la fiche du modèle, il peut gérer jusqu'à neuf images de référence, trois clips vidéo et trois clips audio par prompt. Cependant, deux composants restent fermés : le module pour la résolution 2K et H3-Context-IR, qui convertit les prompts et les éléments de référence en une forme intermédiaire structurée. Localement dans ComfyUI, cela donne une sortie en 768p, mais le traitement du contexte peut être reproduit en suivant les guides de prompt publiés. Les poids ouverts permettent également le fine-tuning, par exemple sur ses propres séquences, personnages ou un style cohérent, bien que la licence ne permette une utilisation commerciale qu'aux entreprises dont le chiffre d'affaires est inférieur à vingt millions de dollars. Parallèlement, ByteDance a publié Seedance 2.5, un modèle fermé qui génère des clips de trente secondes avec audio.
Source: The Decoder (DE) —
original
