Gemini 3.5 Live Translate:スムーズで自然な音声翻訳
Google/DeepMind
Google DeepMind は、70以上の言語を検出し、抑揚を保持した自然な翻訳音声を生成する音声間翻訳モデル Gemini 3.5 Live Translate をリリースしました。このモデルは、Gemini Live API、Google Meet、Google 翻訳アプリなど、Google の製品全体に展開され、連続ストリーミングとノイズ耐性を備えています。
Google DeepMindは、新しい音声モデル「Gemini 3.5 Live Translate」を発表しました。これはリアルタイムの音声間翻訳を行うモデルで、70以上の言語を自動検出し、話者のイントネーション、テンポ、ピッチを保持しながら滑らかな翻訳音声を生成します。従来のターンバイターン方式とは異なり、このモデルは音声を連続的にストリーミングし、話者からわずか数秒遅れるだけで動作します。本日より、Google製品全体で段階的に展開が開始され、開発者向けにはGemini Live APIとGoogle AI Studioでパブリックプレビュー、企業向けには今月中にGoogle Meetでプライベートプレビュー、消費者向けにはAndroidおよびiOSのGoogle翻訳アプリで提供されます。手動設定なしで多言語入力を処理し、ノイズにも強いです。Agora、Fishjam、LiveKit、Pipecat、Vision Agentsなどの開発者プラットフォームは、Gemini Live APIと統合し、音声翻訳アプリの構築を容易にしています。パートナー企業のGrabは、ドライバーと旅行者間の多言語コミュニケーションのためにこのモデルをテスト中です。CJ ENMやLiveKitなどの企業は、翻訳品質と低レイテンシーについて肯定的なフィードバックを寄せています。Google Meetでは、音声翻訳が5言語から70以上の言語に拡大され、2000以上の言語ペアが可能になります。Google翻訳アプリには、Androidでイヤホンを通じて翻訳を再生する「リスニングモード」が導入されました。生成されたすべての音声には、誤情報を防ぐためにSynthIDで透かしが入れられています。
出典: Google DeepMind —
原文
