Hugging Face और Cerebras ने Gemma 4 पर आधारित रीयल-टाइम वॉयस AI के लिए हाथ मिलाया
Hugging Face
Cerebras Systems
NVIDIA
Google DeepMind
Alibaba/Qwen
Hugging Face और Cerebras ने Google DeepMind के Gemma 4 मॉडल का उपयोग करते हुए एक ओपन-सोर्स रीयल-टाइम स्पीच सिंथेसिस पाइपलाइन पेश की है। यह सिस्टम Nvidia की स्पीच रिकॉग्निशन, Cerebras के अनुमान और Alibaba के स्पीच सिंथेसिस को एकीकृत करता है, जिससे प्राकृतिक संवाद के लिए न्यूनतम विलंबता सुनिश्चित होती है। डेवलपर्स प्रत्येक घटक को पूरी तरह से संशोधित और विस्तारित कर सकते हैं।
Hugging Face ने Cerebras के साथ मिलकर एक ओपन-सोर्स रियल-टाइम स्पीच सिंथेसिस पाइपलाइन बनाई है जो एआई के साथ आवाज संवाद को यथासंभव प्राकृतिक बनाती है। सिस्टम 'स्पीच इनपुट -> Nvidia Parakeet के माध्यम से स्पीच रिकॉग्निशन -> Cerebras एक्सेलेरेटर्स पर मल्टीमॉडल लैंग्वेज मॉडल Gemma 4 (Google DeepMind द्वारा विकसित) से आउटपुट -> Alibaba के Qwen3TTS के माध्यम से स्पीच सिंथेसिस -> स्पीच आउटपुट' के सिद्धांत पर काम करता है। प्रत्येक घटक खुला, मॉड्यूलर और बदली जाने योग्य है, जिससे डेवलपर्स अपने असिस्टेंट, रोबोट या शोध परियोजनाओं के लिए स्टैक को अनुकूलित कर सकते हैं। लेटेंसी स्थिरता पर विशेष ध्यान दिया गया है: हालांकि कई सिस्टम स्वीकार्य मीडियन लेटेंसी दिखाते हैं, P95 (सबसे धीमे 5% अनुरोध) पर अभी भी मल्टी-सेकंड रुकावटें होती हैं। Cerebras तेज और अनुमानित लैंग्वेज मॉडल इनफ़रेंस सुनिश्चित करके इस समस्या का समाधान करता है। यही पाइपलाइन पहले से Reachy Mini रोबोट में इस्तेमाल हो रही है, जिनकी 10,000 से अधिक इकाइयाँ मौजूद हैं। डेवलपर्स को Hugging Face Space पर डेमो आज़माने और huggingface/speech-to-speech रिपॉजिटरी से कोड के साथ प्रयोग करने के लिए आमंत्रित किया जाता है।
स्रोत: Hugging Face blog —
मूल
