MiniMax lanza MiniMax H3: modelo de vídeo omni-modal que genera clips 2K de 15 segundos con audio estéreo nativo
MiniMax
Google/DeepMind
ByteDance
MiniMax ha presentado MiniMax H3, un modelo de generación multimodal de propósito general que unifica el procesamiento de texto, imagen, vídeo y audio, generando vídeo 2K con sonido estéreo nativo. El modelo está disponible a través de la API y en la aplicación Hailuo AI, con pesos abiertos prometidos próximamente. Con un precio agresivo, H3 lidera en edición de vídeo, pero queda por detrás de sus rivales en otros puntos de referencia.
MiniMax ha lanzado MiniMax H3, un modelo de generación multimodal de propósito general que lee texto, imágenes, vídeo y audio como un contexto unificado y devuelve vídeo con audio estéreo nativo, con soporte para resolución 2K y duraciones de 4 a 15 segundos (solo enteros). A diferencia de las arquitecturas anteriores que requerían modelos separados para texto a vídeo, imagen a vídeo y otras tareas, H3 integra todo esto en un solo paradigma de preentrenamiento donde las relaciones se expresan en lenguaje natural, como hacer referencia al movimiento de cámara de un vídeo o igualar voces con audio. El modelo se lanzó el 31 de julio de 2026 y está disponible a través de la API con el ID de modelo MiniMax-H3 y en la aplicación de consumo Hailuo AI. Está orientado a publicidad, branding, comercio electrónico, diseño de productos, UI/UX, juegos, previsualización de películas y medios de catálogo minorista, con aplicaciones que incluyen variantes de anuncios, vídeos de productos, pósteres animados y transferencia de movimiento de vídeo a vídeo. La API admite tres modos de entrada: texto a vídeo, imagen a vídeo con primer o último fotograma, y generación con referencia, con límites de entrada que incluyen hasta 9 imágenes de referencia, 3 vídeos de referencia (de 2 a 15 segundos cada uno, ≤15 segundos en total) y 3 clips de audio de referencia (el audio requiere ir acompañado de imagen o vídeo). El límite de entrada mixta es de 12 archivos; las indicaciones (prompts) tienen un máximo de 7.000 caracteres; el cuerpo de la solicitud tiene un máximo de 64 MB; los tamaños de archivo son: vídeo ≤50 MB, imagen ≤30 MB y audio ≤15 MB. Los formatos incluyen vídeo H.264/H.265, imágenes JPG/PNG/WEBP/HEIC/HEIF y audio WAV/MP3. Cuatro componentes técnicos permiten su rendimiento: Representación Ómnica Contextual (un subtitulado que describe relaciones, destilando de ~100 mil tokens a ~4 mil), H3-VAE (un tokenizador con una ganancia efectiva de longitud de secuencia de 4× que permite 2K nativo), Transformador Ómnico H3 (separa las cargas de trabajo de comprensión y generación, aumentando el rendimiento del entrenamiento en ~30%) y Regeneración en Contexto (el modelo base regenera la salida de baja resolución en contexto en lugar de añadir superresolución). Afirmaciones de precios: en 2K, el precio por segundo es inferior a un tercio del de los modelos principales; en 768p, inferior a la mitad del precio de los modelos principales en 720p. Los rastreadores de terceros reportan $0,13 por segundo (~$1,95 por clip de 15 segundos), pero la página de pago por uso de MiniMax todavía muestra los niveles de Hailuo 2.3. Según el South China Morning Post (SCMP), citando a Artificial Analysis, H3 lidera en edición de vídeo, va por detrás de Gemini Omni Flash de Google en texto a vídeo, y se sitúa detrás de Seedance 2.0 y Gemini Omni Flash en imagen a vídeo. Se prometen pesos abiertos 'en los próximos días', pero aún no se han publicado.
Fuente: MarkTechPost —
original
