Génération MédiaModèles 🇺🇸 01.08.2026 12:02

MiniMax lance MiniMax H3 : un modèle vidéo omni-modal générant des clips 2K de 15 secondes avec audio stéréo natif

MiniMaxMiniMax Google/DeepMindGoogle/DeepMind ByteDanceByteDance
MiniMax a dévoilé MiniMax H3, un modèle de génération multimodale polyvalent qui unifie le traitement du texte, de l'image, de la vidéo et de l'audio, produisant des vidéos 2K avec un son stéréo natif. Le modèle est disponible via API et dans l'application Hailuo AI, avec des poids ouverts promis bientôt. Avec un prix agressif, H3 est en tête dans le montage vidéo mais reste en retrait par rapport à ses rivaux sur d'autres références.
MiniMax a publié MiniMax H3, un modèle de génération multimodale polyvalent qui lit le texte, les images, la vidéo et l'audio comme un contexte unifié et renvoie une vidéo avec un son stéréo natif, prenant en charge la résolution 2K, des durées de 4 à 15 secondes (entiers uniquement). Contrairement aux piles précédentes qui nécessitaient des modèles distincts pour le texte-vers-vidéo, l'image-vers-vidéo et d'autres tâches, H3 les intègre dans un paradigme de pré-entraînement unique où les relations sont exprimées en langage naturel, par exemple en référencant le mouvement de caméra à partir d'une vidéo ou en faisant correspondre les voix à l'audio. Le modèle a été lancé le 31 juillet 2026, disponible via l'API sous l'identifiant de modèle MiniMax-H3 et dans l'application grand public Hailuo AI. Il est positionné pour la publicité, l'image de marque, le commerce électronique, la conception de produits, l'interface utilisateur et l'expérience utilisateur, les jeux, la prévisualisation de films et les médias de catalogue de vente au détail, avec des applications incluant des variantes publicitaires, des vidéos de produits, des affiches animées et le transfert de mouvement vidéo-vers-vidéo. L'API prend en charge trois modes d'entrée—texte-vers-vidéo, image-vers-vidéo avec première/dernière image, et génération par référence—avec des limites d'entrée incluant jusqu'à 9 images de référence, 3 vidéos de référence (2 à 15 s chacune, ≤15 s au total) et 3 clips audio de référence (l'audio nécessite une image/vidéo accompagnante). Le plafond d'entrées mixtes est de 12 fichiers ; les invites ≤7 000 caractères ; le corps de la requête ≤64 Mo ; les tailles de fichiers : vidéo ≤50 Mo, image ≤30 Mo, audio ≤15 Mo. Les formats incluent H.264/H.265 pour la vidéo, JPG/PNG/WEBP/HEIC/HEIF pour les images, et WAV/MP3 pour l'audio. Quatre composants techniques permettent sa performance : la Représentation Omni Contextuelle (légendes décrivant les relations, distillant environ 100 000 jetons à environ 4 000), H3-VAE (un tokeniseur avec un gain de longueur de séquence effective de 4× permettant le 2K natif), le Transformateur Omni H3 (sépare les charges de travail de compréhension et de génération, augmentant le débit d'entraînement d'environ 30 %), et la Régénération Intra-Contexte (le modèle de base régénère les sorties basse résolution en contexte au lieu d'ajouter une super-résolution). Revendications de prix : en 2K, le prix par seconde est inférieur à un tiers des modèles dominants ; en 768p, inférieur à la moitié du 720p dominant. Les trackers tiers rapportent 0,13 $ par seconde (environ 1,95 $ par clip de 15 secondes), mais la page de paiement à l'usage de MiniMax répertorie toujours les niveaux Hailuo 2.3. Selon le SCMP citant Artificial Analysis, H3 est en tête dans l'édition vidéo, est en retard sur Gemini Omni Flash de Google dans le texte-vers-vidéo, et se situe derrière Seedance 2.0 et Gemini Omni Flash dans l'image-vers-vidéo. Les poids ouverts sont promis « dans les prochains jours » mais pas encore publiés.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches