⚡ BREAKING
Google DeepMind esittelee Gemini Omni -monimodaalisen mallin videon luomiseen ja muokkaamiseen
Google/DeepMind
DeepMind
Google DeepMind on julkistanut Gemini Omni -mallin, joka pystyy tuottamaan videota minkä tahansa syötteiden yhdistelmästä: kuvat, ääni, video ja teksti. Ensimmäinen versio, Gemini Omni Flash, on jo saatavilla Gemini-sovelluksessa, Google Flow'ssa ja YouTube Shortsissa, ja se tulee pian saataville kehittäjille API:n kautta.
Google DeepMind on esitellyt Gemini Omnin, uuden multimodaalisen mallin, joka yhdistää päättely- ja luovuuskyvyt. Malli ottaa syötteenä kuvia, ääntä, videoita ja tekstiä, ja tuottaa tulosteena korkealaatuisia videoita hyödyntäen Geminin tietämystä reaalimaailmasta. Ensimmäinen versio, Gemini Omni Flash, on nyt saatavilla Gemini-sovelluksessa, Google Flowssa ja YouTube Shortsissa (ilmaiseksi YouTube Shortsin ja YouTube Create -sovelluksen käyttäjille). Google AI Plus-, Pro- ja Ultra-tilaajille se on myös saatavilla maailmanlaajuisesti. Seuraavien viikkojen aikana malli tulee saataville kehittäjille ja yritysasiakkaille API:n kautta. Keskeisiä ominaisuuksia ovat: videoiden muokkaaminen luonnollisen kielen keskustelun avulla (hahmot, fysiikka ja kohtaukset pysyvät yhtenäisinä); videoiden luominen parannetulla fysiikalla (painovoima, kineettinen energia, hydrodynamiikka); Geminin tietämyksen hyödyntäminen historiassa, tieteessä ja kulttuurikontekstissa realistiseen tarinankerrontaan; ja minkä tahansa syötetyyppien yhdistelmän tuki (kuva, teksti, video, ääni; äänessä toistaiseksi vain ääniviittaukset). Turvallisuuden varmistamiseksi on käytössä näkymätön digitaalinen vesileima, SynthID, sekä sisällöntarkistustyökalut Gemini-sovelluksen, Chromen ja Google-haun kautta. Tulevaisuudessa malli oppii tuottamaan kuvia ja ääntä.
Lähde: Google DeepMind —
Alkuperäinen
