Hugging Face e Cerebras unem forças para IA de voz em tempo real baseada no Gemma 4
Hugging Face
Cerebras Systems
NVIDIA
Google DeepMind
Alibaba/Qwen
A Hugging Face e a Cerebras apresentaram um pipeline de síntese de fala em tempo real e de código aberto utilizando o modelo Gemma 4 do Google DeepMind. O sistema integra o reconhecimento de fala da Nvidia, a inferência da Cerebras e a síntese de fala da Alibaba, garantindo latência mínima para diálogos naturais. Os desenvolvedores podem modificar e estender completamente cada componente.
Hugging Face, em parceria com a Cerebras, criou um pipeline de síntese de fala em tempo real de código aberto que torna a interação por voz com a IA o mais natural possível. O sistema funciona segundo o princípio de 'entrada de fala -> reconhecimento de fala via Nvidia Parakeet -> saída do modelo de linguagem multimodal Gemma 4 (desenvolvido pelo Google DeepMind) em aceleradores Cerebras -> síntese de fala via Qwen3TTS da Alibaba -> saída de fala'. Cada componente é aberto, modular e substituível, permitindo que desenvolvedores adaptem a pilha para seus assistentes, robôs ou projetos de pesquisa. Atenção especial é dada à estabilidade de latência: embora muitos sistemas apresentem latência mediana aceitável, no percentil 95 (P95), ou seja, nos 5% de requisições mais lentas, ainda ocorrem pausas de vários segundos. A Cerebras resolve esse problema garantindo inferência rápida e previsível do modelo de linguagem. Esse mesmo pipeline já está sendo usado nos robôs Reachy Mini, com mais de 10.000 unidades existentes. Os desenvolvedores são convidados a testar a demonstração no Hugging Face Space e a experimentar o código do repositório huggingface/speech-to-speech.
Fonte: Hugging Face blog —
original
