Hugging Face dan Cerebras Bergabung untuk Voice AI Real-Time Berbasis Gemma 4
Hugging Face
Cerebras Systems
NVIDIA
Google DeepMind
Alibaba/Qwen
Hugging Face dan Cerebras telah memperkenalkan pipeline sintesis ucapan real-time sumber terbuka yang memanfaatkan model Gemma 4 dari Google DeepMind. Sistem ini mengintegrasikan pengenalan ucapan Nvidia, inferensi Cerebras, dan sintesis ucapan Alibaba, memastikan latensi minimal untuk dialog alami. Pengembang dapat sepenuhnya memodifikasi dan memperluas setiap komponen.
Hugging Face bersama Cerebras menciptakan pipeline sintesis ucapan real-time sumber terbuka yang membuat interaksi suara dengan AI senatural mungkin. Sistem ini beroperasi berdasarkan prinsip "masukan ucapan -> pengenalan ucapan melalui Nvidia Parakeet -> keluaran dari model bahasa multimodal Gemma 4 (dikembangkan oleh Google DeepMind) pada akselerator Cerebras -> sintesis ucapan melalui Qwen3TTS milik Alibaba -> keluaran ucapan." Setiap komponen bersifat terbuka, modular, dan dapat diganti, memungkinkan pengembang untuk menyesuaikan tumpukan teknologi untuk asisten, robot, atau proyek penelitian mereka. Perhatian khusus diberikan pada stabilitas latensi: meskipun banyak sistem menunjukkan latensi median yang dapat diterima, pada P95 (persentil ke-95, yaitu 5% permintaan terlambat), jeda multi-detik masih terjadi. Cerebras memecahkan masalah ini dengan memastikan inferensi model bahasa yang cepat dan dapat diprediksi. Pipeline yang sama ini sudah digunakan pada robot Reachy Mini, dengan lebih dari 10.000 unit yang ada. Pengembang diundang untuk mencoba demo di Hugging Face Space dan bereksperimen dengan kode dari repositori huggingface/speech-to-speech.
Sumber: Hugging Face blog —
asli
