하드웨어 및 추론미디어 생성 🇺🇸 27.07.2026 05:04

허깅 페이스와 Cerebras, Gemma 4 기반 실시간 음성 AI 협력 발표

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
허깅 페이스와 Cerebras가 구글 딥마인드의 Gemma 4 모델을 활용한 오픈소스 실시간 음성 합성 파이프라인을 공개했습니다. 이 시스템은 엔비디아 음성 인식, Cerebras 추론, 알리바바 음성 합성을 통합하여 자연스러운 대화를 위한 최소 지연 시간을 보장합니다. 개발자는 각 구성 요소를 완전히 수정하고 확장할 수 있습니다.
Hugging Face와 Cerebras가 협력하여 AI와의 음성 상호작용을 최대한 자연스럽게 만드는 오픈소스 실시간 음성 합성 파이프라인을 만들었습니다. 이 시스템은 '음성 입력 -> Nvidia Parakeet을 통한 음성 인식 -> Cerebras 가속기에서 Google DeepMind가 개발한 멀티모달 언어 모델 Gemma 4의 출력 -> Alibaba의 Qwen3TTS를 통한 음성 합성 -> 음성 출력' 원리로 작동합니다. 각 구성 요소는 개방형, 모듈식, 교체 가능하여 개발자가 자신의 어시스턴트, 로봇 또는 연구 프로젝트에 맞게 스택을 조정할 수 있습니다. 특히 지연 시간 안정성에 주목합니다. 많은 시스템이 허용 가능한 중간 지연 시간을 보여주지만, P95(가장 느린 5% 요청)에서는 여전히 수 초의 일시 중지가 발생합니다. Cerebras는 빠르고 예측 가능한 언어 모델 추론을 보장함으로써 이 문제를 해결합니다. 이 동일한 파이프라인은 이미 Reachy Mini 로봇에서 사용 중이며, 10,000대 이상의 로봇이 존재합니다. 개발자는 Hugging Face Space에서 데모를 체험하고 huggingface/speech-to-speech 저장소의 코드를 실험해 볼 것을 권장합니다.
출처: Hugging Face blog — 원문
관련 게시물 ↓
새로운 뉴스