Sinh phương tiệnMô hình 🇨🇳 07.08.2026 08:02

Mô hình video Wan 3.0 của Alibaba mở bản beta công khai: Tài liệu và PPT cũng có thể thành video

Alibaba/QwenAlibaba/Qwen
Vào ngày 6 tháng 8, Alibaba đã ra mắt bản beta công khai của mô hình tạo video Wan 3.0. Mô hình này có thể tạo ra một video dài 30 giây trong một lần chạy và lần đầu tiên hỗ trợ các định dạng tài liệu như doc, xls, ppt, pdf và md. Mục tiêu là tái hiện chính xác thế giới thực với hình ảnh con người chân thực.
Ngày 6/8, Alibaba đã chính thức mở beta công khai cho mô hình lớn tạo video Wan 3.0, với các nâng cấp về thời lượng tạo video, khả năng sáng tạo đa năng, tham chiếu vạn năng và tái hiện thế giới thực. Mô hình có thể tạo video dài 30 giây chỉ trong một lần chạy, thể hiện đầy đủ ý đồ sáng tạo. Lần đầu tiên, Wan 3.0 hỗ trợ đầu vào ở các định dạng tài liệu ngoài bốn phương thức cơ bản là văn bản, hình ảnh, âm thanh và video, bao gồm doc, xls, ppt, pdf và md. Mô hình nỗ lực tái hiện chính xác thế giới thực, với mỗi nhân vật có ngoại hình riêng biệt và từng khung hình đều chân thực, đáng tin cậy. Việc kéo dài thời lượng tạo video là bản nâng cấp trực quan nhất, cho phép thực hiện các chuyển động máy quay phức tạp như lia máy liên tục (panning) và quay một cú máy dài (one-shot take). Wan 3.0 còn có tính năng đề xuất thời lượng thông minh, tự động gợi ý độ dài phù hợp dựa trên câu lệnh (prompt). Mô hình đang chuyển mình từ một công cụ tạo video thành một phương tiện thể hiện thông tin, có khả năng đọc thông tin có cấu trúc từ tài liệu và PPT, rồi kết hợp với câu lệnh để tạo ra học liệu giảng dạy, video giới thiệu sản phẩm và báo cáo kinh doanh. Các định dạng được hỗ trợ bao gồm doc, xls, ppt, pdf, md, với dung lượng mỗi tệp hoặc đường liên kết không vượt quá 100MB và 50 trang. Ví dụ, khi tải lên một file PPT giới thiệu kính thông minh kèm theo câu lệnh, hệ thống sẽ tạo ra một video quảng bá hoàn chỉnh. Điều này được hỗ trợ bởi khả năng xử lý câu lệnh (prompt engineering) mạnh mẽ và năng lực tuân thủ chỉ dẫn của mô hình, biến câu lệnh trở thành trung tâm điều phối đầu vào và kiểm soát cách thể hiện nội dung. Các mô hình tạo video đang nâng cấp từ việc tạo nội dung đơn thuần thành công cụ năng suất, và người dùng không chỉ đòi hỏi độ nét mà còn cả tính chân thực. Wan 3.0 tái hiện và thể hiện chính xác cả cảnh thực lẫn thông tin số, với các nhân vật được tạo ra hướng đến khuôn mặt độc đáo riêng biệt, chi tiết gương mặt và làn da tinh xảo, biểu cảm cảm xúc tự nhiên và tiết chế, cùng sự phối hợp nhịp nhàng giữa các vi biểu cảm và chuyển động cơ thể. Trong các tác vụ tham chiếu vạn năng, những yếu tố chi tiết như nhân vật, đạo cụ, âm thanh, quan hệ không gian và phong cách đều được duy trì ổn định. Chất lượng hình ảnh của thông tin số cũng được cải thiện, mang lại cảm giác chân thực về chất liệu cho biểu đồ, dữ liệu và nội dung giao diện. Ngoài ra, khả năng chỉnh sửa video của Wan 3.0 được tăng cường đáng kể, hỗ trợ chỉnh sửa hình ảnh, cốt truyện và lời thoại. Tuy nhiên, chất lượng âm thanh và độ chính xác văn bản vẫn còn dư địa để cải thiện. Bắt đầu từ nay, Wan 3.0 đã mở beta công khai trên Alibaba Cloud Bailian, Wanjing Yike, trang chủ Wanxiang, phiên bản PC của Qianwen Creation, IF STUDIO và Duijiu, đồng thời được triển khai thử nghiệm dần (grayscale rollout) trên ứng dụng Qianwen. Giá API cho các độ phân giải 480P, 720P và 1080P lần lượt là 0,3, 0,6 và 1,2 nhân dân tệ mỗi giây, và giao diện API sẽ sớm được mở hoàn toàn.
Nguồn: QbitAI 量子位 — bản gốc
Bài viết liên quan trước đây ↓
Tin mới