⚡ 速報
Google DeepMind、ビデオ作成・編集向けマルチモーダルモデル「Gemini Omni」を発表
Google/DeepMind
DeepMind
Google DeepMindは、画像、音声、ビデオ、テキストの任意の組み合わせからビデオを生成・編集できるマルチモーダルAIモデル「Gemini Omni」を発表しました。このファミリーの第1モデル「Gemini Omni Flash」は、GeminiアプリおよびGoogle Flowを通じてGoogle AI Plus、Pro、Ultraの加入者向けに提供開始され、YouTube Shortsユーザーには無料で利用可能となる予定です。
Google DeepMindは、Geminiの推論能力と創造力を組み合わせたマルチモーダルモデル「Gemini Omni」を発表しました。このモデルは、画像、音声、動画、テキストなどあらゆる入力モダリティから動画を生成・編集できます。自然言語による動画編集をサポートし、編集全体でキャラクターの一貫性や物理法則を維持し、Geminiの物理学、歴史、科学、文化に関する実世界の知識に基づいた動画を生成できます。会話を通じた編集、シーンの変換、オブジェクトの追加、複数ターンにわたる改良などの機能を提供します。最初のモデルであるGemini Omni Flashは、Google AI Plus、Pro、Ultraの加入者向けに、GeminiアプリとGoogle Flowを通じてグローバルに展開されており、YouTube ShortsおよびYouTube Createアプリのユーザーにも無料で提供されます。生成された動画にはすべて、透明性のためにSynthIDデジタルウォーターマークが含まれています。開発者および企業向けのAPIアクセスは、数週間以内に提供予定です。
出典: Google DeepMind —
原文
