⚡ EN DIRECT
Google DeepMind présente Gemini Omni : modèle multimodal pour la création et l'édition vidéo
Google/DeepMind
DeepMind
Google DeepMind a dévoilé Gemini Omni, un modèle d'IA multimodal capable de générer et d'éditer des vidéos à partir de n'importe quelle combinaison d'images, d'audio, de vidéo et de texte. Le premier modèle de la famille, Gemini Omni Flash, est déployé pour les abonnés à Google AI Plus, Pro et Ultra via l'application Gemini et Google Flow, et sera disponible gratuitement pour les utilisateurs de YouTube Shorts.
Google DeepMind a dévoilé Gemini Omni, un modèle multimodal qui combine le raisonnement de Gemini à des capacités créatives pour générer et éditer des vidéos à partir de n'importe quel type d'entrée, y compris des images, de l'audio, de la vidéo et du texte. Le modèle prend en charge l'édition vidéo en langage naturel, maintient la cohérence des personnages et la physique à travers les éditions, et peut générer des vidéos ancrées dans la connaissance du monde réel de Gemini en physique, histoire, science et culture. Il offre des fonctionnalités telles que l'édition par conversation, la transformation de scènes, l'ajout d'objets et l'affinement sur plusieurs tours. Le premier modèle, Gemini Omni Flash, est déployé pour les abonnés Google AI Plus, Pro et Ultra dans le monde entier via l'application Gemini et Google Flow, ainsi que pour les utilisateurs de YouTube Shorts et de l'application YouTube Create sans frais supplémentaires. Toutes les vidéos générées incluent un filigrane numérique SynthID pour la transparence. L'accès à l'API pour les développeurs et les entreprises est prévu dans les semaines à venir.
Source: Google DeepMind —
original
