硬件与推理媒体生成 🇺🇸 27.07.2026 05:04

Hugging Face 与 Cerebras 联手,基于 Gemma 4 打造实时语音 AI

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
Hugging Face 和 Cerebras 推出了一款开源实时语音合成流水线,利用 Google DeepMind 的 Gemma 4 模型。该系统整合了 Nvidia 语音识别、Cerebras 推理和阿里巴巴语音合成,确保自然对话的最低延迟。开发者可以完全修改和扩展每个组件。
Hugging Face 与 Cerebras 合作创建了一个开源实时语音合成管道,使与 AI 的语音交互尽可能自然。该系统的工作原理是“语音输入 -> 通过 Nvidia Parakeet 进行语音识别 -> 在 Cerebras 加速器上运行来自 Google DeepMind 的多模态语言模型 Gemma 4 生成输出 -> 通过阿里巴巴的 Qwen3TTS 进行语音合成 -> 语音输出”。每个组件都是开放、模块化且可替换的,允许开发者为自己的助手、机器人或研究项目调整这一技术栈。特别关注延迟稳定性:尽管许多系统显示出可接受的中位数延迟,但在 P95(即最慢的 5% 请求)情况下,仍会出现数秒的停顿。Cerebras 通过确保快速且可预测的语言模型推理来解决这个问题。同样的管道已用于 Reachy Mini 机器人,现有超过 10,000 台。开发者受邀在 Hugging Face Space 上尝试演示,并从 huggingface/speech-to-speech 仓库中试验代码。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻