Hugging Face et Cerebras unissent leurs forces pour une IA vocale en temps réel basée sur Gemma 4
Hugging Face
Cerebras Systems
NVIDIA
Google DeepMind
Alibaba/Qwen
Hugging Face et Cerebras ont présenté un pipeline open source de synthèse vocale en temps réel utilisant le modèle Gemma 4 de Google DeepMind. Le système intègre la reconnaissance vocale de Nvidia, l'inférence de Cerebras et la synthèse vocale d'Alibaba, garantissant une latence minimale pour un dialogue naturel. Les développeurs peuvent entièrement modifier et étendre chaque composant.
Hugging Face, en collaboration avec Cerebras, a créé un pipeline de synthèse vocale en temps réel open source qui rend l'interaction vocale avec l'IA aussi naturelle que possible. Le système fonctionne selon le principe « entrée vocale -> reconnaissance vocale via Nvidia Parakeet -> sortie du modèle de langage multimodal Gemma 4 (développé par Google DeepMind) sur les accélérateurs Cerebras -> synthèse vocale via le Qwen3TTS d'Alibaba -> sortie vocale ». Chaque composant est ouvert, modulaire et remplaçable, permettant aux développeurs d'adapter la pile pour leurs assistants, robots ou projets de recherche. Une attention particulière est portée à la stabilité de la latence : bien que de nombreux systèmes présentent une latence médiane acceptable, au P95 (les 5 % de requêtes les plus lentes), des pauses de plusieurs secondes se produisent encore. Cerebras résout ce problème en garantissant une inférence rapide et prévisible du modèle de langage. Ce même pipeline est déjà utilisé dans les robots Reachy Mini, avec plus de 10 000 unités existantes. Les développeurs sont invités à essayer la démo sur Hugging Face Space et à expérimenter avec le code du dépôt huggingface/speech-to-speech.
Source: Hugging Face blog —
original
