Perangkat Keras & InferensiGenerasi Media 🇺🇸 27.07.2026 05:04

Hugging Face dan Cerebras Bergabung untuk Voice AI Real-Time Berbasis Gemma 4

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
Hugging Face dan Cerebras telah memperkenalkan pipeline sintesis ucapan real-time sumber terbuka yang memanfaatkan model Gemma 4 dari Google DeepMind. Sistem ini mengintegrasikan pengenalan ucapan Nvidia, inferensi Cerebras, dan sintesis ucapan Alibaba, memastikan latensi minimal untuk dialog alami. Pengembang dapat sepenuhnya memodifikasi dan memperluas setiap komponen.
Hugging Face bersama Cerebras menciptakan pipeline sintesis ucapan real-time sumber terbuka yang membuat interaksi suara dengan AI senatural mungkin. Sistem ini beroperasi berdasarkan prinsip "masukan ucapan -> pengenalan ucapan melalui Nvidia Parakeet -> keluaran dari model bahasa multimodal Gemma 4 (dikembangkan oleh Google DeepMind) pada akselerator Cerebras -> sintesis ucapan melalui Qwen3TTS milik Alibaba -> keluaran ucapan." Setiap komponen bersifat terbuka, modular, dan dapat diganti, memungkinkan pengembang untuk menyesuaikan tumpukan teknologi untuk asisten, robot, atau proyek penelitian mereka. Perhatian khusus diberikan pada stabilitas latensi: meskipun banyak sistem menunjukkan latensi median yang dapat diterima, pada P95 (persentil ke-95, yaitu 5% permintaan terlambat), jeda multi-detik masih terjadi. Cerebras memecahkan masalah ini dengan memastikan inferensi model bahasa yang cepat dan dapat diprediksi. Pipeline yang sama ini sudah digunakan pada robot Reachy Mini, dengan lebih dari 10.000 unit yang ada. Pengembang diundang untuk mencoba demo di Hugging Face Space dan bereksperimen dengan kode dari repositori huggingface/speech-to-speech.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru