Hugging Face và Cerebras Hợp Tác Phát Triển AI Giọng Nói Thời Gian Thực Dựa Trên Gemma 4
Hugging Face
Cerebras Systems
NVIDIA
Google DeepMind
Alibaba/Qwen
Hugging Face và Cerebras đã giới thiệu một pipeline tổng hợp giọng nói thời gian thực mã nguồn mở sử dụng mô hình Gemma 4 của Google DeepMind. Hệ thống tích hợp nhận dạng giọng nói của Nvidia, suy luận của Cerebras và tổng hợp giọng nói của Alibaba, đảm bảo độ trễ tối thiểu cho hội thoại tự nhiên. Các nhà phát triển có thể tự do sửa đổi và mở rộng từng thành phần.
Hugging Face cùng với Cerebras đã tạo ra một pipeline tổng hợp giọng nói thời gian thực mã nguồn mở, giúp tương tác bằng giọng nói với AI trở nên tự nhiên nhất có thể. Hệ thống hoạt động theo nguyên lý "đầu vào giọng nói -> nhận dạng giọng nói qua Nvidia Parakeet -> đầu ra từ mô hình ngôn ngữ đa phương thức Gemma 4 (do Google DeepMind phát triển) trên các bộ tăng tốc Cerebras -> tổng hợp giọng nói qua Qwen3TTS của Alibaba -> đầu ra giọng nói." Mỗi thành phần đều mở, có dạng module và có thể thay thế, cho phép các nhà phát triển điều chỉnh pipeline cho trợ lý, robot hoặc dự án nghiên cứu của họ. Đặc biệt chú trọng đến độ ổn định độ trễ: mặc dù nhiều hệ thống cho thấy độ trễ trung bình chấp nhận được, nhưng ở phân vị thứ 95 (P95 - 5% yêu cầu chậm nhất), vẫn xảy ra hiện tượng tạm dừng kéo dài nhiều giây. Cerebras giải quyết vấn đề này bằng cách đảm bảo suy luận mô hình ngôn ngữ nhanh và có thể dự đoán trước. Pipeline tương tự này đã được sử dụng trong robot Reachy Mini, với hơn 10.000 thiết bị đang hoạt động. Các nhà phát triển được mời dùng thử bản demo trên Hugging Face Space và thử nghiệm với mã nguồn từ kho lưu trữ huggingface/speech-to-speech.
Nguồn: Hugging Face blog —
bản gốc
