Ứng dụngSinh phương tiện 🇺🇸 27.07.2026 12:03

Gemini 3.5 Live Translate: dịch giọng nói mượt mà và tự nhiên

Google/DeepMindGoogle/DeepMind
Google DeepMind đã phát hành Gemini 3.5 Live Translate, một mô hình dịch thuật từ giọng nói sang giọng nói có khả năng phát hiện hơn 70 ngôn ngữ và tạo ra giọng nói dịch tự nhiên với ngữ điệu được bảo toàn. Mô hình này được triển khai trên các sản phẩm của Google bao gồm Gemini Live API, Google Meet và ứng dụng Google Translate, với khả năng phát trực tuyến liên tục và chống nhiễu.
Google DeepMind công bố Gemini 3.5 Live Translate, một mô hình âm thanh mới cho dịch thuật giọng nói thời gian thực, tự động phát hiện hơn 70 ngôn ngữ và tạo ra giọng nói dịch mượt mà trong khi vẫn giữ nguyên ngữ điệu, nhịp độ và cao độ của người nói. Không giống các hệ thống dịch theo lượt, mô hình này phát trực tiếp giọng nói liên tục, chỉ chậm hơn người nói vài giây. Mô hình được triển khai từ hôm nay trên các sản phẩm của Google: dành cho nhà phát triển qua API Gemini Live và Google AI Studio ở chế độ xem trước công khai; dành cho doanh nghiệp ở chế độ xem trước riêng tư trong tháng này trên Google Meet; và dành cho người dùng qua Google Dịch trên Android và iOS. Mô hình xử lý đầu vào đa ngôn ngữ mà không cần cấu hình thủ công và có khả năng chống nhiễu tốt. Các nền tảng nhà phát triển như Agora, Fishjam, LiveKit, Pipecat và Vision Agents đã tích hợp với API Gemini Live để đơn giản hóa việc xây dựng ứng dụng dịch giọng nói. Đối tác Grab đang thử nghiệm mô hình cho giao tiếp đa ngôn ngữ giữa tài xế và hành khách. Các công ty như CJ ENM và LiveKit đã đưa ra phản hồi tích cực về chất lượng dịch và độ trễ thấp. Trên Google Meet, dịch giọng nói sẽ mở rộng từ 5 ngôn ngữ lên hơn 70 ngôn ngữ, cho phép hơn 2000 tổ hợp ngôn ngữ. Ứng dụng Google Dịch giới thiệu chế độ 'nghe' trên Android, phát bản dịch qua tai nghe của điện thoại. Tất cả âm thanh được tạo ra đều được đánh dấu bản quyền bằng SynthID để ngăn chặn thông tin sai lệch.
Nguồn: Google DeepMind — bản gốc
Bài viết liên quan trước đây ↓
Tin mới