⚡ EN DIRECT
Google DeepMind présente Gemini Omni : un modèle multimodal pour la création et l'édition vidéo
Google/DeepMind
DeepMind
Google DeepMind a annoncé Gemini Omni, un nouveau modèle capable de générer des vidéos à partir de n'importe quelle combinaison d'entrées : images, audio, vidéo et texte. La première version, Gemini Omni Flash, est déjà disponible dans l'application Gemini, Google Flow et YouTube Shorts, et sera bientôt accessible aux développeurs via API.
Google DeepMind a dévoilé Gemini Omni, un nouveau modèle multimodal qui combine capacités de raisonnement et de créativité. Le modèle accepte en entrée des images, de l'audio, de la vidéo et du texte, et génère en sortie des vidéos de haute qualité, en s'appuyant sur les connaissances de Gemini sur le monde réel. La première version, Gemini Omni Flash, est déjà disponible dans l'application Gemini, Google Flow et YouTube Shorts (gratuitement pour les utilisateurs de YouTube Shorts et de l'application YouTube Create). Elle est également accessible mondialement pour les abonnés Google AI Plus, Pro et Ultra. Dans les semaines à venir, le modèle sera proposé aux développeurs et aux clients professionnels via une API. Parmi les principales fonctionnalités : la possibilité de modifier des vidéos par le biais d'un dialogue en langage naturel (les personnages, la physique et les scènes restent cohérents) ; la création de vidéos avec une physique améliorée (gravité, énergie cinétique, hydrodynamique) ; l'utilisation des connaissances de Gemini en histoire, sciences et contexte culturel pour une narration réaliste ; la prise en charge de toute combinaison de données d'entrée (image, texte, vidéo, audio ; pour l'audio, seules des références vocales pour l'instant). Pour la sécurité, un filigrane numérique invisible SynthID a été intégré, ainsi que des outils de vérification du contenu via l'application Gemini, Chrome et Google Search. À l'avenir, le modèle apprendra à générer des images et de l'audio.
Source: Google DeepMind —
original
