Traducción en vivo con Gemini 3.5: traducción de voz fluida y natural
Google/DeepMind
Google DeepMind ha lanzado Gemini 3.5 Live Translate, un modelo de traducción de voz a voz que detecta más de 70 idiomas y genera habla traducida de sonido natural con la entonación preservada. El modelo se despliega en productos de Google, incluyendo la API de Gemini Live, Google Meet y las aplicaciones de Google Translate, con transmisión continua y robustez frente al ruido.
Google DeepMind anunció Gemini 3.5 Live Translate, un nuevo modelo de audio para traducción en vivo de voz a voz que detecta automáticamente más de 70 idiomas y genera voz traducida de forma fluida, preservando la entonación, el ritmo y el tono del hablante. A diferencia de los sistemas de turnos, el modelo transmite el habla de forma continua, manteniéndose solo unos segundos por detrás del hablante. El modelo comienza a implementarse a partir de hoy en los productos de Google: para desarrolladores a través de la API Gemini Live y Google AI Studio en vista previa pública; para empresas en vista previa privada este mes en Google Meet; y para consumidores a través de Google Traductor en Android e iOS. Procesa entradas multilingües sin configuración manual y es robusto frente al ruido. Plataformas de desarrollo como Agora, Fishjam, LiveKit, Pipecat y Vision Agents se han integrado con la API Gemini Live para simplificar la creación de aplicaciones de traducción de voz. El socio Grab está probando el modelo para la comunicación multilingüe entre conductores y viajeros. Empresas como CJ ENM y LiveKit han dado comentarios positivos sobre la calidad de la traducción y la baja latencia. En Google Meet, la traducción de voz se ampliará de 5 idiomas a más de 70, lo que permite más de 2000 combinaciones de idiomas. La aplicación Google Traductor introduce un 'modo de escucha' en Android que reproduce las traducciones a través del auricular del teléfono. Todo el audio generado está marcado con SynthID para evitar la desinformación.
Fuente: Google DeepMind —
original
