⚡ 突发新闻
Google DeepMind 推出 Gemini Omni:用于视频创作与编辑的多模态模型
Google/DeepMind
DeepMind
Google DeepMind 发布了 Gemini Omni,这是一款能够基于图像、音频、视频和文本任意组合输入生成视频的新模型。首个版本 Gemini Omni Flash 已在 Gemini 应用、Google Flow 和 YouTube Shorts 中上线,并将很快通过 API 提供给开发者。
Google DeepMind 发布了 Gemini Omni——一款融合推理与创造能力的新型多模态模型。该模型可接收图像、音频、视频和文本输入,并基于 Gemini 对现实世界的知识生成高质量视频。首个版本 Gemini Omni Flash 已在 Gemini 应用、Google Flow 和 YouTube Shorts 中上线(对 YouTube Shorts 和 YouTube Create App 用户免费)。Google AI Plus、Pro 和 Ultra 订阅用户也可全球使用。未来几周内,该模型将通过 API 向开发者和企业客户开放。主要特性包括:通过自然语言对话编辑视频(角色、物理规则和场景保持一致性);生成具有增强物理效果(重力、动能、流体动力学)的视频;利用 Gemini 在历史、科学和文化背景方面的知识实现逼真叙事;支持任意组合的输入数据(图像、文本、视频、音频;音频当前仅限语音参考)。安全方面,引入了不可见的数字水印 SynthID,以及通过 Gemini 应用、Chrome 和 Google 搜索进行内容审核的工具。未来,该模型还将支持生成图像和音频。
来源: Google DeepMind —
原文
