Gemini 3.5 Live Translate: tradução de voz suave e natural
Google/DeepMind
O Google DeepMind lançou o Gemini 3.5 Live Translate, um modelo de tradução de fala para fala que detecta mais de 70 idiomas e gera uma fala traduzida de som natural com entonação preservada. O modelo está sendo implementado em produtos do Google, incluindo a API Gemini Live, Google Meet e os aplicativos Google Translate, com streaming contínuo e robustez a ruídos.
O Google DeepMind anunciou o Gemini 3.5 Live Translate, um novo modelo de áudio para tradução ao vivo de fala para fala que detecta automaticamente mais de 70 idiomas e gera fala traduzida de forma fluida, preservando a entonação, o ritmo e a altura tonal do falante. Diferentemente de sistemas baseados em turnos, o modelo transmite fala continuamente, ficando apenas alguns segundos atrás do falante. O modelo está sendo lançado a partir de hoje em vários produtos do Google: para desenvolvedores, via Gemini Live API e Google AI Studio em pré-visualização pública; para empresas, em pré-visualização privada neste mês no Google Meet; e para consumidores, via Google Translate no Android e iOS. Ele processa entradas multilíngues sem configuração manual e é robusto contra ruídos. Plataformas de desenvolvedores como Agora, Fishjam, LiveKit, Pipecat e Vision Agents integraram-se com a Gemini Live API para simplificar a criação de aplicativos de tradução por voz. A parceira Grab está testando o modelo para comunicação multilíngue entre motoristas e viajantes. Empresas como CJ ENM e LiveKit deram feedback positivo sobre a qualidade da tradução e a baixa latência. No Google Meet, a tradução de fala será expandida de 5 idiomas para mais de 70, possibilitando mais de 2.000 combinações de idiomas. O aplicativo Google Translate introduz um 'modo de escuta' no Android que reproduz traduções pelo fone de ouvido do telefone. Todo áudio gerado é marcado com SynthID para evitar desinformação.
Fonte: Google DeepMind —
original
