Gemini 3.5 Live Translate: 부드럽고 자연스러운 음성 번역
Google/DeepMind
Google DeepMind가 Gemini 3.5 Live Translate를 출시했습니다. 이 모델은 70개 이상의 언어를 감지하고 억양을 유지하며 자연스러운 번역 음성을 생성하는 음성-음성 번역 모델입니다. Gemini Live API, Google Meet, Google Translate 앱 등 Google 제품 전반에 걸쳐 출시되며, 연속 스트리밍과 잡음 내성을 제공합니다.
Google DeepMind이 Gemini 3.5 Live Translate를 발표했습니다. 이는 실시간 음성-음성 번역을 위한 새로운 오디오 모델로, 70개 이상의 언어를 자동으로 감지하고 화자의 억양, 속도, 음높이를 유지하면서 매끄러운 번역 음성을 생성합니다. 턴바이턴(turn-by-turn) 시스템과 달리 이 모델은 음성을 연속적으로 스트리밍하며 화자보다 불과 몇 초 뒤쳐집니다. 이 모델은 오늘부터 Google 제품 전반에 걸쳐 출시됩니다: 개발자 대상으로는 Gemini Live API와 Google AI Studio에서 공개 미리보기로, 기업 대상으로는 이번 달 Google Meet에서 비공개 미리보기로, 소비자 대상으로는 Android 및 iOS용 Google Translate에서 제공됩니다. 수동 설정 없이 다중 언어 입력을 처리하며 잡음에도 강합니다. Agora, Fishjam, LiveKit, Pipecat, Vision Agents와 같은 개발자 플랫폼은 Gemini Live API와 통합하여 음성 번역 앱 구축을 간소화했습니다. 파트너사인 Grab은 운전자와 여행자 간의 다중 언어 소통을 위해 이 모델을 테스트 중입니다. CJ ENM과 LiveKit 같은 기업들은 번역 품질과 낮은 지연 시간에 대해 긍정적인 피드백을 제공했습니다. Google Meet에서 음성 번역은 5개 언어에서 70개 이상의 언어로 확장되어 2000개 이상의 언어 조합을 지원하게 됩니다. Google Translate 앱은 Android용 '듣기 모드'를 도입하여 전화 수화기를 통해 번역을 재생합니다. 생성된 모든 오디오에는 오정보를 방지하기 위해 SynthID 워터마크가 포함됩니다.
출처: Google DeepMind —
원문
