Gemini 3.5 Live Translate: sujuvaa ja luonnollista äänikäännöstä
Google/DeepMind
Google DeepMind on julkaissut Gemini 3.5 Live Translate -mallin, joka on puheesta puheeksi -käännösmalli. Se tunnistaa yli 70 kieltä ja tuottaa luonnollisen kuuloista käännettyä puhetta, jossa säilyy alkuperäinen intonaatio. Malli otetaan käyttöön Google-tuotteissa, kuten Gemini Live API:ssa, Google Meet:ssä ja Google Kääntäjä-sovelluksissa, ja se tarjoaa jatkuvaa suoratoistoa ja kestävyyttä taustamelua vastaan.
Google DeepMind julkisti Gemini 3.5 Live Translate -mallin, uuden ääniä käsittelevän tekoälymallin elävään puheesta puheeksi -käännökseen, joka tunnistaa automaattisesti yli 70 kieltä ja tuottaa sulavaa käännettyä puhetta säilyttäen puhujan äänensävyn, rytmin ja sävelkorkeuden. Toisin kuin vuoropohjaiset järjestelmät, malli suoratoistaa puhetta jatkuvasti, pysyen vain muutaman sekunnin päässä puhujasta. Malli otetaan käyttöön tästä päivästä alkaen useissa Googlen tuotteissa: kehittäjille Gemini Live API:n ja Google AI Studion kautta julkisessa esiversiossa, yrityksille yksityisessä esiversiossa tässä kuussa Google Meetissä ja kuluttajille Google Translate -sovelluksen kautta Androidilla ja iOS:llä. Se käsittelee monikielistä syötettä ilman manuaalista määritystä ja on häiriösietoinen. Kehittäjäalustat, kuten Agora, Fishjam, LiveKit, Pipecat ja Vision Agents, ovat integroituneet Gemini Live API:in helpottaakseen äänikäännössovellusten rakentamista. Kumppani Grab testaa mallia monikieliseen viestintään kuljettajien ja matkustajien välillä. Yritykset, kuten CJ ENM ja LiveKit, ovat antaneet positiivista palautetta käännöksen laadusta ja matalasta viiveestä. Google Meetissä puhekäännös laajenee viidestä kielestä yli 70 kieleen, mahdollistaen yli 2000 kieliyhdistelmää. Google Translate -sovellus ottaa käyttöön Androidilla 'kuuntelutilan', joka toistaa käännökset puhelimen kuulokkeen kautta. Kaikki luotu ääni vesileimataan SynthID:llä väärän tiedon leviämisen estämiseksi.
Lähde: Google DeepMind —
Alkuperäinen
