Le modèle vidéo Wan 3.0 d'Alibaba ouvre sa bêta publique : les documents et les présentations peuvent aussi devenir des vidéos
Alibaba/Qwen
Le 6 août, Alibaba a lancé la bêta publique de son modèle de génération vidéo Wan 3.0. Le modèle peut générer une vidéo de 30 secondes en une seule exécution et prend en charge pour la première fois des formats de documents tels que doc, xls, ppt, pdf et md. Il vise à reproduire avec précision le monde réel avec des personnages réalistes.
Le 6 août, Alibaba a ouvert la version bêta publique de son grand modèle de génération vidéo Wan 3.0, avec des améliorations en matière de durée de génération, de création universelle, de référence omnipotente et de restitution du monde réel. Il peut générer une vidéo de 30 secondes en une seule exécution, exprimant pleinement l'intention créative. Pour la première fois, il prend en charge la saisie de formats de documents au-delà des quatre modalités de base que sont le texte, l'image, l'audio et la vidéo, notamment doc, xls, ppt, pdf et md. Le modèle s'efforce de restituer fidèlement le monde réel, chaque personne ayant une apparence unique et chaque plan étant à la fois réaliste et crédible. L'extension de la durée de génération est la mise à niveau la plus intuitive, permettant des mouvements de caméra complexes comme le panoramique continu et les plans-séquences. Wan 3.0 dispose également d'une fonction de durée intelligente qui recommande automatiquement une durée appropriée en fonction de l'invite. Il passe d'un modèle de génération vidéo à un vecteur d'expression de l'information, capable de lire des informations structurées à partir de documents et de présentations, et de générer des supports de cours, des démonstrations de produits et des rapports d'entreprise lorsqu'il est combiné à des invites. Les formats pris en charge couvrent doc, xls, ppt, pdf, md, chaque fichier ou lien ne dépassant pas 100 Mo et 50 pages. Par exemple, le téléchargement d'une présentation pour des lunettes intelligentes avec une invite donne une vidéo promotionnelle complète. Cela repose sur les solides capacités d'ingénierie d'invites et de suivi d'instructions du modèle, qui transforment les invites en un centre de planification des entrées et de contrôle de l'expression. Les modèles de génération vidéo évoluent de la génération de contenu vers des outils de productivité, et les utilisateurs exigent non seulement de la clarté, mais aussi du réalisme. Wan 3.0 reproduit et présente avec précision à la fois les scènes réelles et les informations numériques, avec des figures humaines générées visant des visages uniques, des traits fins et une peau détaillée, des expressions émotionnelles naturelles et mesurées, ainsi que des micro-expressions et des mouvements corporels coordonnés. Dans les tâches de référence omnipotente, des aspects fins comme le personnage, les accessoires, le son, les relations spatiales et le style sont maintenus de manière stable. La qualité visuelle des informations numériques est également améliorée, donnant aux graphiques, aux données et aux contenus d'interface une sensation de texture. De plus, les capacités de montage vidéo de Wan 3.0 sont grandement améliorées, prenant en charge les modifications des visuels, de l'intrigue et du dialogue. Il reste encore des améliorations possibles en ce qui concerne la qualité du son et la précision du texte. À partir de maintenant, Wan 3.0 est en version bêta publique sur Alibaba Cloud Bailian, Wanjing Yike, le site officiel de Wanxiang, Qianwen Creation PC, IF STUDIO et Duijiu, avec un déploiement progressif sur l'application Qianwen. Les prix de l'API pour 480P, 720P et 1080P sont respectivement de 0,3, 0,6 et 1,2 yuan par seconde, et l'interface API sera bientôt entièrement ouverte.
Source: QbitAI 量子位 —
original
