Hugging Face と Cerebras が Gemma 4 をベースにしたリアルタイム音声 AI で協力
Hugging Face
Cerebras Systems
NVIDIA
Google DeepMind
Alibaba/Qwen
Hugging Face と Cerebras は、Google DeepMind の Gemma 4 モデルを利用したオープンソースのリアルタイム音声合成パイプラインを発表しました。このシステムは、Nvidia の音声認識、Cerebras の推論、Alibaba の音声合成を統合し、自然な対話のための最小限の遅延を実現します。開発者は各コンポーネントを完全に修正および拡張できます。
Hugging FaceはCerebrasと共同で、AIとの音声インタラクションを可能な限り自然にする、オープンソースのリアルタイム音声合成パイプラインを開発しました。このシステムは「音声入力 → Nvidia Parakeetによる音声認識 → Cerebrasアクセラレータ上でGoogle DeepMind開発のマルチモーダル言語モデルGemma 4からの出力 → AlibabaのQwen3TTSによる音声合成 → 音声出力」という原理で動作します。各コンポーネントはオープンでモジュール化されており、交換可能なため、開発者は自身のアシスタント、ロボット、研究プロジェクトに合わせてスタックを適応させることができます。特にレイテンシの安定性に注目しており、多くのシステムは許容範囲の中央値レイテンシを示すものの、第95パーセンタイル(最も遅い5%のリクエスト)では数秒の停止が依然として発生します。Cerebrasは、高速で予測可能な言語モデル推論を実現することでこの問題を解決しています。この同じパイプラインは既にReachy Miniロボットでも使用されており、1万台以上のユニットが存在します。開発者はHugging Face Spaceでデモを試したり、huggingface/speech-to-speechリポジトリのコードを実験することが推奨されています。
出典: Hugging Face blog —
原文
