Gemini 3.5 Live Translate: सहज और प्राकृतिक ध्वनि अनुवाद
Google/DeepMind
Google DeepMind ने Gemini 3.5 Live Translate जारी किया है, जो एक स्पीच-टू-स्पीच अनुवाद मॉडल है। यह 70 से अधिक भाषाओं का पता लगाता है और संरक्षित स्वर के साथ प्राकृतिक ध्वनि वाला अनुवादित भाषण उत्पन्न करता है। यह मॉडल Gemini Live API, Google Meet और Google Translate ऐप सहित Google उत्पादों में रोल आउट हो रहा है, जिसमें सतत स्ट्रीमिंग और शोर सहनशीलता शामिल है।
Google DeepMind ने Gemini 3.5 Live Translate की घोषणा की है, जो लाइव स्पीच-टू-स्पीच अनुवाद के लिए एक नया ऑडियो मॉडल है। यह स्वचालित रूप से 70 से अधिक भाषाओं का पता लगाता है और वक्ता की स्वर-शैली, गति और पिच को बनाए रखते हुए सहज अनुवादित भाषण उत्पन्न करता है। टर्न-बाय-टर्न सिस्टम के विपरीत, यह मॉडल लगातार भाषण स्ट्रीम करता है, वक्ता से केवल कुछ सेकंड पीछे रहता है। यह मॉडल आज से Google उत्पादों में रोल आउट होना शुरू हो रहा है: डेवलपर्स के लिए Gemini Live API और Google AI Studio में सार्वजनिक पूर्वावलोकन के रूप में; उद्यमों के लिए इस महीने Google Meet में निजी पूर्वावलोकन में; और उपभोक्ताओं के लिए Android और iOS पर Google Translate के माध्यम से। यह मैन्युअल कॉन्फ़िगरेशन के बिना बहुभाषी इनपुट को प्रोसेस करता है और शोर के प्रति मजबूत है। Agora, Fishjam, LiveKit, Pipecat और Vision Agents जैसे डेवलपर प्लेटफार्मों ने वॉयस ट्रांसलेशन ऐप बनाने को सरल बनाने के लिए Gemini Live API के साथ एकीकरण किया है। पार्टनर Grab ड्राइवरों और यात्रियों के बीच बहुभाषी संचार के लिए इस मॉडल का परीक्षण कर रहा है। CJ ENM और LiveKit जैसी कंपनियों ने अनुवाद गुणवत्ता और कम विलंबता पर सकारात्मक प्रतिक्रिया दी है। Google Meet में, भाषण अनुवाद 5 भाषाओं से बढ़ाकर 70 से अधिक भाषाओं तक हो जाएगा, जिससे 2000 से अधिक भाषा संयोजन संभव होंगे। Google Translate ऐप Android पर एक 'लिसनिंग मोड' पेश करता है जो फ़ोन के ईयरपीस के माध्यम से अनुवाद चलाता है। सभी उत्पन्न ऑडियो को गलत सूचना को रोकने के लिए SynthID के साथ वॉटरमार्क किया जाता है।
स्रोत: Google DeepMind —
मूल
