MiniMax H3 : le réseau neuronal qui réalise, sonorise et monte lui-même
MiniMax a publié H3 (également connu sous le nom de Hailuo 3.0), un modèle d'IA multimodal qui génère des vidéos avec un son synchronisé, effectue des montages en suivant des vidéos de référence, et gère même la suppression de fond vert. Le modèle est open source sous licence, avec des poids disponibles sur Hugging Face, et prend en charge une résolution allant jusqu'à 2K via API. Il vise à unifier le traitement du texte, de l'image, de la vidéo et de l'audio en un seul contexte.
MiniMax a présenté H3, également connu sous le nom de Hailuo 3.0 ou Hailuo 03, un modèle multimodal capable de générer des vidéos de 4 à 15 secondes à 24 images par seconde avec un son stéréo natif à 32 kHz, et jusqu'à une résolution de 2K via l'API ou 768p en auto-hébergement. Le modèle peut accepter jusqu'à 9 images de référence, 3 vidéos et 3 fichiers audio simultanément, et peut éditer des vidéos pour correspondre au rythme et au style d'un clip de référence. Il supprime également les fonds verts et ajuste l'éclairage. L'architecture compresse les sources en descriptions linguistiques (réduisant environ 100 000 jetons à 4 000), utilise un tokenizer VAE redessiné avec une quadruplement de la longueur effective de séquence, et inclut un calcul séparé pour la compréhension et la génération. MiniMax a publié les poids du modèle sur Hugging Face les 2 et 3 août 2026, plusieurs jours après le lancement de l'API le 31 juillet 2026. Les démonstrations montrent que le modèle gère des requêtes complexes pour l'édition, la publicité et les transitions fluides, mais il a encore du mal avec les petits textes sur vidéo, une faiblesse courante dans les modèles de génération vidéo.
Source: Habr — хаб ИИ —
original
