⚡ BREAKING
MallitMediatuotanto 🇺🇸 27.07.2026 14:04

Google DeepMind esittelee Gemini Omni -monimodaalisen mallin videoiden luomiseen ja muokkaamiseen

Google/DeepMindGoogle/DeepMind DeepMindDeepMind
Google DeepMind on julkaissut Gemini Omni -nimisen monimodaalisen tekoälymallin, joka pystyy luomaan ja muokkaamaan videoita minkä tahansa kuvien, äänen, videon ja tekstin yhdistelmästä. Perheen ensimmäinen malli, Gemini Omni Flash, otetaan käyttöön Google AI Plus-, Pro- ja Ultra -tilaajille Gemini-sovelluksen ja Google Flow’n kautta, ja se on ilmaiseksi saatavilla YouTube Shorts -käyttäjille.
Google DeepMind julkisti Gemini Omni -multimodaalimallin, joka yhdistää Geminin päättelykyvyn luoviin ominaisuuksiin tuottaakseen ja muokatakseen videoita mistä tahansa syötemuodosta, kuten kuvista, äänestä, videosta ja tekstistä. Malli tukee luonnollisen kielen videomuokkausta, säilyttää hahmojen johdonmukaisuuden ja fysiikan muokkausten välillä, ja pystyy tuottamaan videoita, jotka perustuvat Geminin reaalimaailman tietämykseen fysiikasta, historiasta, tieteestä ja kulttuurista. Se tarjoaa ominaisuuksia, kuten keskustelun kautta muokkaamisen, kohtausten muuntamisen, objektien lisäämisen ja tarkentamisen useiden vuorojen aikana. Ensimmäinen malli, Gemini Omni Flash, otetaan käyttöön Google AI Plus-, Pro- ja Ultra -tilaajille maailmanlaajuisesti Gemini-sovelluksen ja Google Flow:n kautta, sekä YouTube Shorts- ja YouTube Create App -käyttäjille ilmaiseksi. Kaikki tuotetut videot sisältävät SynthID-digitaalisen vesileiman läpinäkyvyyden varmistamiseksi. Kehittäjä- ja yritys-API-pääsyä suunnitellaan tuleville viikoille.
Lähde: Google DeepMind — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset