Generación de MediosModelos 🇷🇺 06.08.2026 12:01

MiniMax H3: La red neuronal que dirige, hace sonido y se edita a sí misma

MiniMax ha lanzado H3 (también conocido como Hailuo 3.0), un modelo de IA multimodal que genera video con audio sincronizado, realiza ediciones siguiendo videos de referencia, e incluso maneja la eliminación de pantalla verde. El modelo es de código abierto bajo una licencia, con pesos disponibles en Hugging Face, y soporta hasta resolución 2K vía API. Su objetivo es unificar el procesamiento de texto, imagen, video y audio en un solo contexto.
MiniMax ha presentado H3, también conocido como Hailuo 3.0 o Hailuo 03, un modelo multimodal capaz de generar vídeos de 4 a 15 segundos a 24 fotogramas por segundo con audio estéreo nativo a 32 kHz, y hasta una resolución de 2K a través de su API o 768p cuando se aloja de forma local. El modelo puede procesar hasta 9 imágenes de referencia, 3 vídeos y 3 archivos de audio simultáneamente, y puede editar vídeos para que coincidan con el ritmo y el estilo de un clip de referencia. También elimina fondos de croma y ajusta la iluminación. La arquitectura comprime las fuentes en descripciones de lenguaje (reduciendo aproximadamente de 100 mil tokens a 4 mil), utiliza un tokenizador VAE rediseñado con un aumento cuádruple en la longitud efectiva de la secuencia, e incluye cómputo separado para la comprensión y la generación. MiniMax publicó los pesos del modelo en Hugging Face el 2 y 3 de agosto de 2026, varios días después del lanzamiento de la API el 31 de julio de 2026. Las demostraciones muestran que el modelo maneja indicaciones complejas para edición, publicidad y transiciones fluidas, pero todavía tiene dificultades con texto pequeño en los vídeos, una debilidad común en los modelos generativos de vídeo.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas