Hardware e InferenciaGeneración de Medios 🇺🇸 27.07.2026 05:04

Hugging Face y Cerebras se unen para crear una IA de voz en tiempo real basada en Gemma 4

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
Hugging Face y Cerebras han presentado un pipeline de síntesis de voz en tiempo real de código abierto que utiliza el modelo Gemma 4 de Google DeepMind. El sistema integra reconocimiento de voz de Nvidia, inferencia de Cerebras y síntesis de voz de Alibaba, garantizando una latencia mínima para un diálogo natural. Los desarrolladores pueden modificar y ampliar cada componente por completo.
Hugging Face, en colaboración con Cerebras, ha creado un pipeline de síntesis de voz en tiempo real de código abierto que hace que la interacción por voz con la IA sea lo más natural posible. El sistema funciona bajo el principio de 'entrada de voz -> reconocimiento de voz mediante Nvidia Parakeet -> salida del modelo de lenguaje multimodal Gemma 4 (desarrollado por Google DeepMind) en aceleradores Cerebras -> síntesis de voz mediante Qwen3TTS de Alibaba -> salida de voz'. Cada componente es abierto, modular y reemplazable, lo que permite a los desarrolladores adaptar el stack para sus asistentes, robots o proyectos de investigación. Se presta especial atención a la estabilidad de latencia: aunque muchos sistemas muestran una latencia media aceptable, en el percentil 95 (el 5% de las solicitudes más lentas), siguen ocurriendo pausas de varios segundos. Cerebras resuelve este problema garantizando una inferencia rápida y predecible del modelo de lenguaje. Este mismo pipeline ya se está utilizando en robots Reachy Mini, con más de 10.000 unidades en existencia. Se invita a los desarrolladores a probar la demo en Hugging Face Space y experimentar con el código del repositorio huggingface/speech-to-speech.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas