⚡ ÚLTIMA HORA
ModelosGeração de Mídia 🇺🇸 27.07.2026 14:04

Google DeepMind apresenta Gemini Omni: um modelo multimodal para criação e edição de vídeos

Google/DeepMindGoogle/DeepMind DeepMindDeepMind
O Google DeepMind anunciou o Gemini Omni, um novo modelo capaz de gerar vídeos com base em qualquer combinação de entradas: imagens, áudio, vídeo e texto. A primeira versão, Gemini Omni Flash, já está disponível no aplicativo Gemini, no Google Flow e no YouTube Shorts, e em breve estará disponível para desenvolvedores via API.
O Google DeepMind apresentou o Gemini Omni, um novo modelo multimodal que combina capacidades de raciocínio e criatividade. O modelo aceita como entrada imagens, áudio, vídeo e texto, e produz vídeos de alta qualidade com base no conhecimento do Gemini sobre o mundo real. A primeira versão, Gemini Omni Flash, já está disponível no aplicativo Gemini, no Google Flow e no YouTube Shorts (gratuitamente para usuários do YouTube Shorts e do YouTube Create App). Também está disponível globalmente para assinantes dos planos Google AI Plus, Pro e Ultra. Nas próximas semanas, o modelo será disponibilizado para desenvolvedores e clientes corporativos por meio da Application Programming Interface (API). Entre os principais recursos estão: a capacidade de editar vídeos por meio de diálogo em linguagem natural (personagens, física e cenas mantêm consistência); criação de vídeos com física aprimorada (gravidade, energia cinética, hidrodinâmica); uso do conhecimento do Gemini em história, ciência e contexto cultural para uma narrativa realista; suporte a qualquer combinação de dados de entrada (imagem, texto, vídeo, áudio; áudio atualmente apenas como referências de voz). Para segurança, foi implementada a marca d'água digital invisível SynthID, além de ferramentas de verificação de conteúdo por meio do aplicativo Gemini, Chrome e Google Search. No futuro, o modelo aprenderá a gerar imagens e áudio.
Fonte: Google DeepMind — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas