Generación de MediosModelos 🇨🇳 07.08.2026 08:02

El modelo de video de Alibaba Wan 3.0 abre su beta pública: documentos y presentaciones también pueden convertirse en video

Alibaba/QwenAlibaba/Qwen
El 6 de agosto, Alibaba lanzó la beta pública de su modelo de generación de video Wan 3.0. El modelo puede generar un video de 30 segundos en una sola ejecución y, por primera vez, admite formatos de documento como doc, xls, ppt, pdf y md. Su objetivo es reproducir con precisión el mundo real, con figuras humanas realistas.
El 6 de agosto, Alibaba lanzó la versión beta pública de su gran modelo de generación de video Wan 3.0, que mejora la duración de generación, la creación universal, la referencia omnipotente y la restauración del mundo real. Puede generar un video de 30 segundos en una sola ejecución, expresando plenamente la intención creativa. Por primera vez, admite la entrada de formatos de documentos más allá de las cuatro modalidades básicas de texto, imagen, audio y video, incluyendo doc, xls, ppt, pdf y md. El modelo se esfuerza por restaurar con precisión el mundo real, con cada persona teniendo una apariencia única y cada fotograma siendo tanto realista como creíble. La extensión de la duración de generación es la mejora más intuitiva, permitiendo movimientos de cámara complejos como paneos continuos y tomas de una sola toma. Wan3.0 también tiene una función de duración inteligente que recomienda automáticamente una duración adecuada según la indicación. Está pasando de ser un modelo de generación de video a un vehículo de expresión de información, capaz de leer información estructurada de documentos y presentaciones, y generar cursos educativos, demostraciones de productos e informes comerciales cuando se combina con indicaciones. Los formatos admitidos cubren doc, xls, ppt, pdf, md, con archivos individuales o enlaces que no superen los 100 MB y 50 páginas. Por ejemplo, subir una presentación sobre gafas inteligentes con una indicación produce un video promocional completo. Esto se sustenta en las fuertes capacidades de ingeniería de indicaciones y seguimiento de instrucciones del modelo, que transforman las indicaciones en un centro para programar la entrada y controlar la expresión. Los modelos de generación de video están pasando de la generación de contenido a herramientas de productividad, y los usuarios exigen no solo claridad, sino también realismo. Wan3.0 replica y presenta con precisión tanto escenas reales como información digital, con figuras humanas generadas que buscan rostros únicos, rasgos faciales y piel detallados, expresiones emocionales naturales y contenidas, y microexpresiones y movimientos corporales coordinados. En tareas de referencia omnipotente, aspectos de grano fino como personajes, accesorios, sonido, relaciones espaciales y estilo se mantienen de manera estable. La calidad visual de la información digital también mejora, dando a gráficos, datos y contenido de interfaces una sensación de textura. Además, las capacidades de edición de video de Wan3.0 están muy mejoradas, apoyando modificaciones en lo visual, la trama y el diálogo. Todavía hay margen de mejora en la calidad del sonido y la precisión del texto. A partir de ahora, Wan3.0 está en beta pública en Alibaba Cloud Bailian, Wanjing Yike, el sitio web oficial de Wanxiang, Qianwen Creation PC, IF STUDIO y Duijiu, con un despliegue gradual en la aplicación Qianwen. Los precios de la API para 480P, 720P y 1080P son 0,3, 0,6 y 1,2 yuanes por segundo, respectivamente, y la interfaz de API estará completamente abierta pronto.
Fuente: QbitAI 量子位 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas