⚡ ÚLTIMA HORA
Google DeepMind presenta Gemini Omni: un modelo multimodal para creación y edición de video
Google/DeepMind
DeepMind
Google DeepMind ha anunciado Gemini Omni, un nuevo modelo capaz de generar video a partir de cualquier combinación de entradas: imágenes, audio, video y texto. La primera versión, Gemini Omni Flash, ya está disponible en la aplicación Gemini, Google Flow y YouTube Shorts, y próximamente estará disponible para desarrolladores a través de API.
Google DeepMind ha presentado Gemini Omni, un nuevo modelo multimodal que combina capacidades de razonamiento y creatividad. El modelo acepta como entrada imágenes, audio, video y texto, y genera videos de alta calidad basándose en el conocimiento de Gemini sobre el mundo real. La primera versión, Gemini Omni Flash, ya está disponible en la aplicación Gemini, Google Flow y YouTube Shorts (de forma gratuita para usuarios de YouTube Shorts y la aplicación YouTube Create). También está disponible globalmente para las suscripciones Google AI Plus, Pro y Ultra. En las próximas semanas, el modelo estará disponible para desarrolladores y clientes empresariales a través de una interfaz de programación de aplicaciones (API). Entre las características clave se incluyen: la capacidad de editar videos mediante conversación en lenguaje natural (los personajes, la física y las escenas mantienen coherencia); creación de videos con física mejorada (gravedad, energía cinética, hidrodinámica); uso del conocimiento de Gemini en historia, ciencia y contexto cultural para una narración realista; soporte para cualquier combinación de datos de entrada (imagen, texto, video, audio; el audio por ahora solo como referencias de voz). Para la seguridad, se ha implementado la marca de agua digital invisible SynthID, así como herramientas de verificación de contenido a través de la aplicación Gemini, Chrome y Google Search. En el futuro, el modelo aprenderá a generar imágenes y audio.
Fuente: Google DeepMind —
original
