阿里视频模型万3.0开启公测:文档和PPT也可成片
Alibaba/Qwen
8月6日,阿里发布了视频生成模型万3.0的公测版本。该模型单次生成即可产出30秒的视频,并首次支持doc、xls、ppt、pdf以及md等文档格式。其目标在于精准还原真实世界,呈现逼真的人物形象。
8月6日,阿里影业旗下通义万相宣布正式开放视频生成大模型万相3.0的公测,在生成时长、万能创作、万能参考、真实还原等方面进行了升级。该模型单次可生成30秒视频,充分表达创作意图,并首次支持除文本、图像、音频、视频四种基础模态之外文档格式的输入,包括doc、xls、ppt、pdf和md。模型力求准确还原真实世界,每个人物拥有独一无二的外貌,每一帧画面既真实又可信。生成时长的延长是最直观的升级,支持连续运镜、一镜到底等复杂镜头运动。万相3.0还具备智能时长功能,可根据提示词自动推荐合适的时长。它正从视频生成模型向信息表达载体转变,能够读取文档和PPT中的结构化信息,结合提示词生成教学课件、产品演示和商业报告。支持的格式涵盖doc、xls、ppt、pdf、md,单个文件或链接不超过100MB和50页。例如,上传一份关于智能眼镜的PPT并给出提示词,即可生成一段完整的宣传视频。这背后是模型强大的提示工程和指令跟随能力,将提示词转化为调度输入和控制表达的枢纽。视频生成模型正从内容生成工具升级为生产力工具,用户不仅要求画质清晰,更要求真实感。万相3.0既准确还原真实场景,也精确呈现数字信息,生成的人物力求面部独特,五官和皮肤细节丰富,情绪表达自然克制,微表情和身体动作协调。在万能参考任务中,人物、道具、音效、空间关系和风格等细粒度特征得到稳定保持。数字信息的视觉质量同样提升,图表、数据和界面内容更具质感。此外,万相3.0的视频编辑能力大幅增强,支持对画面、剧情和对话的修改。音质和文字准确性仍有改进空间。即日起,万相3.0在阿里云百炼、万镜一刻、万相官方网站、千问创作PC端、IF STUDIO和兑就开放公测,并通过灰度方式在千问应用上线。API定价为480P、720P和1080P分别每秒0.3元、0.6元和1.2元,API接口即将全面开放。
来源: QbitAI 量子位 —
原文
