Model Video Wan3.0 dari Alibaba Membuka Beta Publik: Dokumen dan PPT Juga Bisa Menjadi Video
Alibaba/Qwen
Pada 6 Agustus, Alibaba meluncurkan beta publik dari model generasi video Wan 3.0. Model ini dapat menghasilkan video berdurasi 30 detik dalam satu kali proses dan untuk pertama kalinya mendukung format dokumen seperti doc, xls, ppt, pdf, dan md. Model ini bertujuan untuk mereproduksi dunia nyata secara akurat dengan figur manusia yang realistis.
Pada 6 Agustus, Alibaba membuka beta publik model video generatif besar Wan 3.0, dengan peningkatan pada durasi generasi, kreasi universal, referensi serba bisa, dan restorasi dunia nyata. Model ini dapat menghasilkan video 30 detik dalam satu kali produksi, sepenuhnya mengekspresikan niat kreatif. Untuk pertama kalinya, model ini mendukung input format dokumen di luar empat modalitas dasar teks, gambar, audio, dan video, termasuk doc, xls, ppt, pdf, dan md. Model ini berupaya mereproduksi dunia nyata secara akurat, dengan setiap orang memiliki penampilan unik dan setiap bingkai terlihat realistis dan kredibel. Perpanjangan durasi generasi menjadi peningkatan paling intuitif, memungkinkan gerakan kamera kompleks seperti panning kontinu dan one-shot takes. Wan3.0 juga memiliki fungsi durasi cerdas yang secara otomatis merekomendasikan durasi yang tepat berdasarkan prompt. Model ini bertransisi dari model generasi video menjadi wahana ekspresi informasi, mampu membaca informasi terstruktur dari dokumen dan PPT, serta menghasilkan materi ajar, demo produk, dan laporan bisnis jika dikombinasikan dengan prompt. Format yang didukung mencakup doc, xls, ppt, pdf, md, dengan file atau tautan individual tidak melebihi 100MB dan 50 halaman. Misalnya, mengunggah PPT untuk kacamata pintar dengan prompt tertentu menghasilkan video promosi lengkap. Ini didukung oleh kemampuan prompt engineering dan kepatuhan instruksi yang kuat dari model, yang mengubah prompt menjadi pusat penjadwalan input dan kontrol ekspresi. Model generasi video sedang meningkat dari generasi konten menjadi alat produktivitas, dan pengguna tidak hanya menuntut kejelasan tetapi juga realisme. Wan3.0 secara akurat mereplikasi dan menyajikan baik pemandangan nyata maupun informasi digital, dengan figur manusia yang dihasilkan menargetkan wajah unik, fitur wajah dan kulit detail, ekspresi emosional yang alami dan terkendali, serta gerakan mikro dan bahasa tubuh yang terkoordinasi. Dalam tugas referensi serba bisa, aspek-butir seperti karakter, properti, suara, hubungan spasial, dan gaya dipertahankan secara stabil. Kualitas visual informasi digital juga ditingkatkan, memberikan grafik, data, dan konten antarmuka nuansa tekstur. Selain itu, kemampuan penyuntingan video Wan3.0 sangat ditingkatkan, mendukung modifikasi visual, alur cerita, dan dialog. Masih ada ruang untuk peningkatan dalam kualitas suara dan akurasi teks. Mulai sekarang, Wan3.0 tersedia dalam beta publik di Alibaba Cloud Bailian, Wanjing Yike, situs web resmi Wanxiang, Qianwen Creation PC, IF STUDIO, dan Duijiu, dengan peluncuran bertahap di aplikasi Qianwen. Harga API untuk 480P, 720P, dan 1080P masing-masing adalah 0,3, 0,6, dan 1,2 yuan per detik, dengan antarmuka API akan segera dibuka sepenuhnya.
Sumber: QbitAI 量子位 —
asli
