Alibaba ra mắt nền tảng giọng nói AI đầu tiên của Trung Quốc CosyVoice Studio, tích hợp khả năng hiểu ngữ nghĩa vào tính năng giọng nói
Alibaba/Qwen
Alibaba đã ra mắt CosyVoice Studio, nền tảng sản xuất giọng nói AI một cửa đầu tiên của Trung Quốc, dựa trên mô hình Qwen-Audio tự phát triển, đứng đầu bảng xếp hạng toàn cầu về nhận dạng giọng nói tự động (ASR), tương tác thời gian thực và tổng hợp giọng nói (TTS). Nền tảng cung cấp ba tính năng chính: bàn phím giọng nói để phiên âm có cấu trúc, công cụ tạo nội dung âm thanh và trình xây dựng tác nhân giọng nói, phục vụ cho doanh nghiệp, nhà phát triển và người dùng cá nhân.
Ngày 7/8, Alibaba đã chính thức ra mắt CosyVoice Studio, nền tảng sản xuất giọng nói AI trọn gói đầu tiên tại Trung Quốc, được xây dựng dựa trên mô hình giọng nói tự phát triển Qwen-Audio. Mô hình này đã giành vị trí số một toàn cầu ở các hạng mục nhận diện giọng nói (ASR - Automatic Speech Recognition), tương tác thời gian thực và tổng hợp giọng nói (TTS - Text-to-Speech) trên nền tảng đánh giá AI uy tín Artificial Analysis. Nền tảng này bao gồm ba tính năng chính: bàn phím giọng nói chuyển đổi lời nói thành văn bản có cấu trúc bằng cách loại bỏ các từ đệm, công cụ sáng tạo nội dung âm thanh biến nội dung của người dùng thành podcast và sách nói, và trợ lý ảo giọng nói cho phép doanh nghiệp tạo ra các tác nhân hội thoại thời gian thực.
Đây là lần đầu tiên Alibaba tổng hợp các năng lực mô hình giọng nói của mình vào một sản phẩm duy nhất, cho phép người dùng doanh nghiệp trải nghiệm thử nghiệm rồi gọi API khi cần, trong khi người dùng cá nhân có thể sử dụng trực tiếp. Bàn phím giọng nói hỗ trợ chuyển văn bản thông minh đối với các dạng văn bản đặc biệt như số liệu và công thức, còn chế độ "ghi chú" được thiết kế dành cho các cuộc họp, phỏng vấn và buổi học kéo dài, với khả năng chuyển lời nói thành văn bản theo thời gian thực, phân tách người nói, cấu trúc hóa thành các chương mục và dịch đa ngôn ngữ.
Công cụ tạo trợ lý ảo, CosyAgent, cho phép người dùng tạo ra các tác nhân bằng ngôn ngữ tự nhiên, hỗ trợ cấu hình chuyên sâu về prompt (câu lệnh) và quy trình làm việc phục vụ cho chăm sóc khách hàng và tiếp thị qua điện thoại. Công cụ sáng tạo nội dung, CosyCreative, cung cấp hàng nghìn giọng đọc cùng khả năng nhân bản giọng nói để tạo ra các podcast dạng hội thoại và sách nói đa vai diễn.
Nền tảng này hiện được cung cấp miễn phí trên iOS, Android, Mac và Windows thông qua các kho ứng dụng, trong khi CosyAgent và CosyCreative đang được thử nghiệm với người dùng doanh nghiệp theo hình thức danh sách trắng (whitelist).
Nguồn: QbitAI 量子位 —
bản gốc
