Hugging Face en Cerebras bundelen krachten voor realtime spraak-AI op basis van Gemma 4
Hugging Face
Cerebras Systems
NVIDIA
Google DeepMind
Alibaba/Qwen
Hugging Face en Cerebras hebben een open-source realtime spraaksynthesepijplijn geïntroduceerd die gebruikmaakt van Google DeepMinds Gemma 4-model. Het systeem integreert spraakherkenning van Nvidia, inferentie van Cerebras en spraaksynthese van Alibaba, wat zorgt voor minimale latentie voor natuurlijke dialogen. Ontwikkelaars kunnen elk onderdeel volledig aanpassen en uitbreiden.
Hugging Face heeft samen met Cerebras een open-source realtime spraaksynthese-pijplijn gecreëerd die steminteractie met AI zo natuurlijk mogelijk maakt. Het systeem werkt volgens het principe 'spraakinvoer -> spraakherkenning via Nvidia Parakeet -> uitvoer van het multimodale taalmodel Gemma 4 (ontwikkeld door Google DeepMind) op Cerebras-versnellers -> spraaksynthese via Alibaba's Qwen3TTS -> spraakuitvoer'. Elk onderdeel is open, modulair en vervangbaar, waardoor ontwikkelaars de stack kunnen aanpassen voor hun assistenten, robots of onderzoeksprojecten. Bijzondere aandacht gaat uit naar latentie-stabiliteit: hoewel veel systemen een acceptabele mediane latentie tonen, treden bij P95 (de 5% traagste verzoeken) nog steeds meer-seconden durende pauzes op. Cerebras lost dit probleem op door snelle en voorspelbare inferentie van het taalmodel te garanderen. Deze zelfde pijplijn wordt al gebruikt in Reachy Mini-robots, waarvan er meer dan 10.000 exemplaren bestaan. Ontwikkelaars worden uitgenodigd om de demo op Hugging Face Space uit te proberen en te experimenteren met de code uit de huggingface/speech-to-speech-repository.
Bron: Hugging Face blog —
origineel
