MiniMax H3 se convierte en el primer modelo de video abierto en encabezar el ranking de edición de video
MiniMax
ByteDance
MiniMax ha publicado los pesos de su modelo de video H3, convirtiéndose en el primer modelo abierto en alcanzar la cima de un ranking de video. Según Artificial Analysis, H3 ocupa el primer lugar en edición de video, el segundo en texto a video y el tercero en imagen a video. El modelo de 33 mil millones de parámetros procesa texto, imágenes, videos y audio de manera conjunta, generando clips con sonido estéreo, pero algunos componentes permanecen cerrados.
MiniMax ha hecho públicos los pesos de su modelo de vídeo H3, marcando la primera vez que un modelo abierto encabeza una clasificación de vídeo. En Artificial Analysis, H3 ocupa el primer puesto en edición de vídeo, el segundo en texto a vídeo y el tercero en imagen a vídeo. El modelo, de 33 mil millones de parámetros, procesa texto, imágenes, vídeos y audio de forma conjunta, produciendo un clip de cuatro a quince segundos con sonido estéreo y, según la ficha del modelo, puede manejar hasta nueve imágenes de referencia, tres clips de vídeo y tres clips de audio por cada instrucción. Sin embargo, dos componentes permanecen cerrados: el módulo para resolución 2K y H3-Context-IR, que convierte las instrucciones y el material de referencia en una forma intermedia estructurada. Localmente en ComfyUI, esto da como resultado una salida de 768p, pero el procesamiento del contexto se puede replicar utilizando las guías de instrucciones publicadas. Los pesos abiertos también permiten el ajuste fino, por ejemplo, con material propio, personajes o un aspecto consistente, aunque la licencia solo permite el uso comercial a empresas con ingresos inferiores a veinte millones de dólares. Al mismo tiempo, ByteDance ha lanzado el modelo cerrado Seedance 2.5, que ofrece clips de treinta segundos con audio.
Fuente: The Decoder (DE) —
original
