⚡ BREAKING
Google DeepMind memperkenalkan Gemini Omni: model multimodal untuk pembuatan dan pengeditan video
Google/DeepMind
DeepMind
Google DeepMind telah meluncurkan Gemini Omni, model AI multimodal yang mampu menghasilkan dan mengedit video dari berbagai kombinasi gambar, audio, video, dan teks. Model pertama dalam keluarga ini, Gemini Omni Flash, mulai diluncurkan untuk pelanggan Google AI Plus, Pro, dan Ultra melalui aplikasi Gemini dan Google Flow, dan akan tersedia untuk pengguna YouTube Shorts secara gratis.
Google DeepMind mengumumkan Gemini Omni, model multimodal yang menggabungkan penalaran Gemini dengan kemampuan kreatif untuk menghasilkan dan mengedit video dari berbagai modalitas masukan, termasuk gambar, audio, video, dan teks. Model ini mendukung pengeditan video melalui bahasa alami, menjaga konsistensi karakter dan fisika antar suntingan, serta dapat menghasilkan video yang didasarkan pada pengetahuan dunia nyata Gemini tentang fisika, sejarah, sains, dan budaya. Fitur-fiturnya mencakup pengeditan melalui percakapan, transformasi adegan, penambahan objek, dan penyempurnaan dalam beberapa putaran. Model pertama, Gemini Omni Flash, mulai diluncurkan untuk pelanggan Google AI Plus, Pro, dan Ultra secara global melalui aplikasi Gemini dan Google Flow, serta juga untuk pengguna YouTube Shorts dan YouTube Create App secara gratis. Semua video yang dihasilkan menyertakan tanda air digital SynthID untuk transparansi. Akses API untuk pengembang dan perusahaan direncanakan dalam beberapa minggu mendatang.
Sumber: Google DeepMind —
asli
