Hugging Face और Cerebras ने Gemma 4 पर आधारित रीयल-टाइम वॉयस AI के लिए हाथ मिलाया

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
Hugging Face और Cerebras ने Google DeepMind के Gemma 4 मॉडल का उपयोग करते हुए एक ओपन-सोर्स रीयल-टाइम स्पीच सिंथेसिस पाइपलाइन पेश की है। यह सिस्टम Nvidia की स्पीच रिकॉग्निशन, Cerebras के अनुमान और Alibaba के स्पीच सिंथेसिस को एकीकृत करता है, जिससे प्राकृतिक संवाद के लिए न्यूनतम विलंबता सुनिश्चित होती है। डेवलपर्स प्रत्येक घटक को पूरी तरह से संशोधित और विस्तारित कर सकते हैं।
Hugging Face ने Cerebras के साथ मिलकर एक ओपन-सोर्स रियल-टाइम स्पीच सिंथेसिस पाइपलाइन बनाई है जो एआई के साथ आवाज संवाद को यथासंभव प्राकृतिक बनाती है। सिस्टम 'स्पीच इनपुट -> Nvidia Parakeet के माध्यम से स्पीच रिकॉग्निशन -> Cerebras एक्सेलेरेटर्स पर मल्टीमॉडल लैंग्वेज मॉडल Gemma 4 (Google DeepMind द्वारा विकसित) से आउटपुट -> Alibaba के Qwen3TTS के माध्यम से स्पीच सिंथेसिस -> स्पीच आउटपुट' के सिद्धांत पर काम करता है। प्रत्येक घटक खुला, मॉड्यूलर और बदली जाने योग्य है, जिससे डेवलपर्स अपने असिस्टेंट, रोबोट या शोध परियोजनाओं के लिए स्टैक को अनुकूलित कर सकते हैं। लेटेंसी स्थिरता पर विशेष ध्यान दिया गया है: हालांकि कई सिस्टम स्वीकार्य मीडियन लेटेंसी दिखाते हैं, P95 (सबसे धीमे 5% अनुरोध) पर अभी भी मल्टी-सेकंड रुकावटें होती हैं। Cerebras तेज और अनुमानित लैंग्वेज मॉडल इनफ़रेंस सुनिश्चित करके इस समस्या का समाधान करता है। यही पाइपलाइन पहले से Reachy Mini रोबोट में इस्तेमाल हो रही है, जिनकी 10,000 से अधिक इकाइयाँ मौजूद हैं। डेवलपर्स को Hugging Face Space पर डेमो आज़माने और huggingface/speech-to-speech रिपॉजिटरी से कोड के साथ प्रयोग करने के लिए आमंत्रित किया जाता है।
स्रोत: Hugging Face blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार