Modelo de Vídeo da Alibaba, Wan 3.0, Abre Beta Pública: Documentos e Apresentações Também Podem Virar Vídeo
Alibaba/Qwen
Em 6 de agosto, a Alibaba lançou a beta pública do seu modelo de geração de vídeo Wan 3.0. O modelo pode gerar um vídeo de 30 segundos em uma única execução e suporta, pela primeira vez, formatos de documento como doc, xls, ppt, pdf e md. Ele busca reproduzir com precisão o mundo real, com figuras humanas realistas.
Em 6 de agosto, a Alibaba abriu o beta público de seu grande modelo de geração de vídeo Wan 3.0, com melhorias em duração de geração, criação universal, referência onipotente e restauração do mundo real. Ele pode gerar um vídeo de 30 segundos em uma única execução, expressando totalmente a intenção criativa. Pela primeira vez, suporta entrada de formatos de documentos além das quatro modalidades básicas de texto, imagem, áudio e vídeo, incluindo doc, xls, ppt, pdf e md. O modelo se esforça para restaurar com precisão o mundo real, com cada pessoa tendo uma aparência única e cada quadro sendo realista e crível. A extensão da duração da geração é a melhoria mais intuitiva, permitindo movimentos complexos de câmera, como panning contínuo e tomadas únicas. O Wan 3.0 também possui uma função de duração inteligente que recomenda automaticamente uma duração apropriada com base no prompt. Ele está transitando de um modelo de geração de vídeo para um veículo de expressão de informações, capaz de ler informações estruturadas de documentos e apresentações e gerar cursos, demonstrações de produtos e relatórios de negócios quando combinado com prompts. Os formatos suportados cobrem doc, xls, ppt, pdf e md, com arquivos individuais ou links não excedendo 100MB e 50 páginas. Por exemplo, enviar uma apresentação para óculos inteligentes com um prompt resulta em um vídeo promocional completo. Isso é sustentado pelas fortes capacidades de engenharia de prompt e seguimento de instruções do modelo, que transformam prompts em um hub para agendar entrada e controlar expressão. Os modelos de geração de vídeo estão evoluindo de geração de conteúdo para ferramentas de produtividade, e os usuários exigem não apenas clareza, mas também realismo. O Wan 3.0 replica e apresenta com precisão tanto cenas reais quanto informações digitais, com figuras humanas geradas visando rostos únicos, características faciais e pele detalhadas, expressões emocionais naturais e contidas, e microexpressões e movimentos corporais coordenados. Em tarefas de referência onipotente, aspectos refinados como personagem, adereços, som, relações espaciais e estilo são mantidos de forma estável. A qualidade visual das informações digitais também é melhorada, dando aos gráficos, dados e conteúdo de interface uma sensação de textura. Além disso, as capacidades de edição de vídeo do Wan 3.0 são grandemente aprimoradas, suportando modificações em visuais, enredo e diálogo. Ainda há espaço para melhorias na qualidade do som e na precisão do texto. Começando imediatamente, o Wan 3.0 está em beta público no Alibaba Cloud Bailian, Wanjing Yike, site oficial do Wanxiang, PC do Qianwen Creation, IF STUDIO e Duijiu, com um lançamento gradual no aplicativo Qianwen. Os preços da API para 480P, 720P e 1080P são 0,3, 0,6 e 1,2 yuan por segundo, respectivamente, com a interface da API a ser totalmente aberta em breve.
Fonte: QbitAI 量子位 —
original
