⚡ ÚLTIMA HORA
ModelosGeneración de Medios 🇺🇸 27.07.2026 14:04

Google DeepMind presenta Gemini Omni: modelo multimodal para creación y edición de video

Google/DeepMindGoogle/DeepMind DeepMindDeepMind
Google DeepMind ha presentado Gemini Omni, un modelo de inteligencia artificial multimodal capaz de generar y editar videos a partir de cualquier combinación de imágenes, audio, video y texto. El primer modelo de la familia, Gemini Omni Flash, se está implementando para los suscriptores de Google AI Plus, Pro y Ultra a través de la aplicación Gemini y Google Flow, y estará disponible para los usuarios de YouTube Shorts de forma gratuita.
Google DeepMind presentó Gemini Omni, un modelo multimodal que combina el razonamiento de Gemini con capacidades creativas para generar y editar videos a partir de cualquier modalidad de entrada, incluyendo imágenes, audio, video y texto. El modelo admite edición de video con lenguaje natural, mantiene la coherencia de los personajes y la física entre las ediciones, y puede generar videos basados en el conocimiento del mundo real de Gemini sobre física, historia, ciencia y cultura. Ofrece funciones como edición mediante conversación, transformación de escenas, agregado de objetos y refinamiento a lo largo de múltiples turnos. El primer modelo, Gemini Omni Flash, se está implementando a nivel mundial para los suscriptores de Google AI Plus, Pro y Ultra a través de la aplicación Gemini y Google Flow, y también para los usuarios de YouTube Shorts y YouTube Create App sin costo alguno. Todos los videos generados incluyen la marca de agua digital SynthID para garantizar la transparencia. Se tiene previsto el acceso a la API para desarrolladores y empresas en las próximas semanas.
Fuente: Google DeepMind — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas