⚡ BREAKING
Google DeepMind introduceert Gemini Omni: een multimodaal model voor videocreatie en -bewerking
Google/DeepMind
DeepMind
Google DeepMind heeft Gemini Omni aangekondigd, een nieuw model dat video kan genereren op basis van elke combinatie van invoer: afbeeldingen, audio, video en tekst. De eerste versie, Gemini Omni Flash, is al beschikbaar in de Gemini-app, Google Flow en YouTube Shorts, en zal binnenkort beschikbaar zijn voor ontwikkelaars via een API.
Google DeepMind heeft Gemini Omni onthuld, een nieuw multimodaal model dat redeneer- en creatieve mogelijkheden combineert. Het model accepteert input in de vorm van afbeeldingen, audio, video en tekst, en genereert output van hoogwaardige videoclips, gebaseerd op Geminis kennis van de echte wereld. De eerste versie, Gemini Omni Flash, is al beschikbaar in de Gemini-app, Google Flow en YouTube Shorts (gratis voor gebruikers van YouTube Shorts en de YouTube Create App). Voor abonnees van Google AI Plus, Pro en Ultra is het ook wereldwijd toegankelijk. In de komende weken komt het model beschikbaar voor ontwikkelaars en zakelijke klanten via een API. Tot de belangrijkste functies behoren: het bewerken van video via natuurlijke taalinteractie (personages, natuurkunde en scènes blijven consistent); het creëren van video met verbeterde fysica (zwaartekracht, kinetische energie, hydrodynamica); het gebruik van Geminis kennis van geschiedenis, wetenschap en culturele context voor realistische storytelling; en ondersteuning voor elke combinatie van invoergegevens (afbeelding, tekst, video, audio; voor audio alleen voice-referenties). Voor veiligheid is een onzichtbaar digitaal watermerk, SynthID, geïmplementeerd, evenals tools voor contentcontrole via de Gemini-app, Chrome en Google Search. In de toekomst zal het model ook afbeeldingen en audio kunnen genereren.
Bron: Google DeepMind —
origineel
