Hardware e InferênciaGeração de Mídia 🇺🇸 27.07.2026 05:04

Hugging Face e Cerebras unem forças para IA de voz em tempo real baseada no Gemma 4

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
A Hugging Face e a Cerebras apresentaram um pipeline de síntese de fala em tempo real e de código aberto utilizando o modelo Gemma 4 do Google DeepMind. O sistema integra o reconhecimento de fala da Nvidia, a inferência da Cerebras e a síntese de fala da Alibaba, garantindo latência mínima para diálogos naturais. Os desenvolvedores podem modificar e estender completamente cada componente.
Hugging Face, em parceria com a Cerebras, criou um pipeline de síntese de fala em tempo real de código aberto que torna a interação por voz com a IA o mais natural possível. O sistema funciona segundo o princípio de 'entrada de fala -> reconhecimento de fala via Nvidia Parakeet -> saída do modelo de linguagem multimodal Gemma 4 (desenvolvido pelo Google DeepMind) em aceleradores Cerebras -> síntese de fala via Qwen3TTS da Alibaba -> saída de fala'. Cada componente é aberto, modular e substituível, permitindo que desenvolvedores adaptem a pilha para seus assistentes, robôs ou projetos de pesquisa. Atenção especial é dada à estabilidade de latência: embora muitos sistemas apresentem latência mediana aceitável, no percentil 95 (P95), ou seja, nos 5% de requisições mais lentas, ainda ocorrem pausas de vários segundos. A Cerebras resolve esse problema garantindo inferência rápida e previsível do modelo de linguagem. Esse mesmo pipeline já está sendo usado nos robôs Reachy Mini, com mais de 10.000 unidades existentes. Os desenvolvedores são convidados a testar a demonstração no Hugging Face Space e a experimentar o código do repositório huggingface/speech-to-speech.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas