Gemini 3.5 Canlı Çeviri: akıcı ve doğal ses çevirisi
Google/DeepMind
Google DeepMind, 70'ten fazla dili algılayan ve tonlamayı koruyarak doğal sesli çeviri yapan bir konuşmadan konuşmaya çeviri modeli olan Gemini 3.5 Canlı Çeviri'yi yayınladı. Model, Gemini Live API, Google Meet ve Google Translate uygulamaları dahil olmak üzere Google ürünlerinde kullanıma sunuluyor ve sürekli akış ve gürültü dayanıklılığı özellikleri sunuyor.
Google DeepMind, canlı konuşmadan konuşmaya çeviri için yeni bir ses modeli olan Gemini 3.5 Live Translate'i duyurdu. Model, 70'ten fazla dili otomatik olarak algılıyor ve konuşmacının tonlamasını, hızını ve perdesini koruyarak akıcı bir şekilde çevrilmiş konuşma üretiyor. Sıra tabanlı sistemlerden farklı olarak model, konuşmayı sürekli olarak akış halinde iletiyor ve konuşmacının yalnızca birkaç saniye gerisinde kalıyor. Model bugünden itibaren Google ürünlerinde kullanıma sunuluyor: Geliştiriciler için Gemini Live API ve Google AI Studio'da herkese açık ön izleme; işletmeler için bu ay Google Meet'te özel ön izleme; tüketiciler için ise Android ve iOS'ta Google Translate uygulaması üzerinden. Model, manuel yapılandırma gerektirmeden çok dilli girdileri işliyor ve gürültüye karşı dayanıklı. Agora, Fishjam, LiveKit, Pipecat ve Vision Agents gibi geliştirici platformları, sesli çeviri uygulamaları oluşturmayı kolaylaştırmak için Gemini Live API ile entegre oldu. Ortak şirket Grab, sürücüler ve yolcular arasındaki çok dilli iletişim için modeli test ediyor. CJ ENM ve LiveKit gibi şirketler, çeviri kalitesi ve düşük gecikme süresi konusunda olumlu geri bildirimler verdi. Google Meet'te konuşma çevirisi 5 dilden 70'in üzerinde dile genişleyerek 2000'den fazla dil kombinasyonuna olanak tanıyacak. Google Translate uygulaması, Android'de telefonun kulaklığından çevirileri oynatan bir 'dinleme modu' sunuyor. Üretilen tüm ses, yanlış bilgiyi önlemek için SynthID ile filigranlanıyor.
Kaynak: Google DeepMind —
orijinal
