Mistral AI ra mắt Voxtral TTS, mô hình tổng hợp giọng nói đa ngôn ngữ
Mistral
ElevenLabs
Mistral AI đã phát hành Voxtral TTS, mô hình chuyển văn bản thành giọng nói với 4 tỷ tham số, mang lại giọng nói chân thực, biểu cảm cảm xúc bằng 9 ngôn ngữ với độ trễ thấp và khả năng tùy chỉnh giọng nói dễ dàng. Mô hình có sẵn qua API và Mistral Studio, với giá khởi điểm 0,016 đô la Mỹ cho mỗi 1.000 ký tự.
Mistral AI vừa công bố Voxtral TTS, mô hình chuyển văn bản thành giọng nói đầu tiên của họ với 4 tỷ tham số, mang đến khả năng tạo giọng nói đa ngôn ngữ tiên tiến. Mô hình hỗ trợ 9 ngôn ngữ: tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Tây Ban Nha, tiếng Hà Lan, tiếng Bồ Đào Nha, tiếng Ý, tiếng Hindi và tiếng Ả Rập. Nó có độ trễ thấp (độ trễ mô hình 70 mili giây), khả năng thích ứng giọng nói đa ngôn ngữ zero-shot (không cần huấn luyện thêm) và hiểu ngữ cảnh để thể hiện cảm xúc. Việc thích ứng giọng nói chỉ cần tối thiểu 3 giây âm thanh tham chiếu. Các đánh giá của con người cho thấy độ tự nhiên vượt trội so với ElevenLabs Flash v2.5, đồng thời đạt chất lượng ngang bằng ElevenLabs v3. Kiến trúc bao gồm phần lõi bộ giải mã transformer 3,4 tỷ tham số, bộ chuyển đổi âm học flow-matching 390 triệu tham số và bộ giải mã âm thanh thần kinh 300 triệu tham số. Có sẵn qua API với giá 0,016 đô la Mỹ cho mỗi 1.000 ký tự và trong Mistral Studio. Một phần trọng số mô hình được mở trên Hugging Face theo giấy phép CC BY NC 4.0.
Nguồn: Mistral AI —
bản gốc
