应用媒体生成 🇺🇸 27.07.2026 12:03

Gemini 3.5 Live Translate:流畅自然的语音翻译

Google/DeepMindGoogle/DeepMind
Google DeepMind 发布了 Gemini 3.5 Live Translate,这是一个语音到语音的翻译模型,能够检测超过 70 种语言,并生成保留语调的自然语音翻译。该模型已在 Google 产品中推出,包括 Gemini Live API、Google Meet 和 Google 翻译应用,支持连续流式传输和噪声鲁棒性。
谷歌DeepMind发布Gemini 3.5 Live Translate,这是一款用于实时语音到语音翻译的新型音频模型,可自动检测超过70种语言,并生成流畅的翻译语音,同时保留说话者的语调、语速和音高。与轮换式系统不同,该模型连续传输语音,仅比说话者滞后几秒。该模型从今天起在谷歌各产品中陆续推出:开发者可通过Gemini Live API和Google AI Studio在公开预览版中使用;企业用户本月可通过Google Meet在私人预览版中体验;消费者可通过安卓和iOS上的谷歌翻译使用。该模型无需手动配置即可处理多语言输入,且对噪音具有鲁棒性。Agora、Fishjam、LiveKit、Pipecat和Vision Agents等开发者平台已集成Gemini Live API,以简化语音翻译应用的构建。合作伙伴Grab正在测试该模型,用于司机与旅客之间的多语言沟通。CJ ENM和LiveKit等公司对翻译质量和低延迟给予了积极反馈。在Google Meet中,语音翻译将从5种语言扩展到70多种语言,支持超过2000种语言组合。谷歌翻译应用在安卓上引入了“听译模式”,可通过手机听筒播放翻译结果。所有生成的音频都带有SynthID水印,以防止虚假信息。
来源: Google DeepMind — 原文
我们之前关于此话题的帖子 ↓
最新新闻