La Postproducción de Video en Riesgo: MiniMax H3 Convierte Bocetos en Efectos, Llega el 'Momento de Codificación' Multimodal
MiniMax
MiniMax lanza su primer modelo de video de código abierto, H3, que integra edición, tipografía, transiciones, ritmo, música de fondo y efectos visuales de principio a fin. Los usuarios pueden ingresar texto y obtener un video listo para publicar, con resolución 2K por defecto. El modelo es elogiado como un nuevo SOTA en edición de video y admite entrada multimodal completa, incluidos texto, imágenes, audio y video.
MiniMax ha lanzado oficialmente su modelo de vídeo de nueva generación, MiniMax H3, que también es su primer modelo de vídeo de código abierto. H3 rompe el paradigma anterior en el que los modelos de vídeo solo generaban metraje en bruto, integrando de extremo a extremo lógica de edición, tipografía, diseño de transiciones, control de ritmo, música de fondo y efectos visuales. Los usuarios pueden introducir texto y recibir un vídeo terminado listo para su publicación, con resolución 2K por defecto. El modelo ha sido bien recibido por desarrolladores en el extranjero y ha encabezado la clasificación de Artificial Analysis en edición de vídeo. El autor probó H3 y descubrió que responde muy bien a la intención del usuario, incluso siguiendo con precisión instrucciones complejas de múltiples planos. H3 también muestra una mejora significativa en la generación de texto en vídeos, un punto que suele fallar en los modelos de vídeo con IA. Puede generar texto que se mantiene consistente entre fotogramas e incluso comprende la relación entre el texto y el contenido visual. Además, H3 puede tomar un clip de audio como entrada para el diálogo, con la voz sincronizada con la emoción y el ritmo de las imágenes, basándose en la experiencia de MiniMax en modelos de voz multimodales. El precio es bajo, ya que el coste por segundo en resolución 2K es menos de un tercio del de los modelos convencionales. H3 admite entrada multimodal completa, lo que significa que todos los tipos de medios forman parte del contexto del modelo. Utiliza un modelo de subtítulos personalizado y una arquitectura H3-Omni Transformer para un procesamiento multimodal eficiente. El enfoque de MiniMax se basa en la emergencia de lo multimodal más el lenguaje, conectando modalidades aisladas a través del lenguaje. La naturaleza de código abierto de H3 permite a las empresas implementarlo de forma privada y ajustarlo para flujos de trabajo de contenido personalizados, lo que podría dar lugar a un aumento de la vitalidad de la propiedad intelectual. MiniMax tiene un historial de lanzamiento de modelos de código abierto, desde la serie M2 hasta ahora H3, en línea con su visión de 'Inteligencia con Todos'. El lanzamiento marca un cambio en la generación de vídeo hacia un 'momento de codificación', donde se convierte en una herramienta de producción comercialmente viable.
Fuente: QbitAI 量子位 —
original
