Mistral AI Unveils Voxtral TTS — New Multilingual Speech Synthesis Model
Mistral
ElevenLabs
Mistral AI has released Voxtral TTS, a speech synthesis model with 4 billion parameters that supports 9 languages, emotionally expressive speech, low latency, and easy voice adaptation. The model is available via API and Mistral Studio, starting at $0.016 per 1,000 characters.
Mistral AI vừa ra mắt Voxtral TTS, mô hình tổng hợp giọng nói đầu tiên của hãng với 4 tỷ tham số. Mô hình tạo ra giọng nói tự nhiên, có cảm xúc trên 9 ngôn ngữ, có tính đến phương ngữ, độ trễ thấp (70 ms cho một mẫu điển hình) và dễ dàng thích ứng với các giọng nói mới. Voxtral TTS vượt trội hơn ElevenLabs Flash v2.5 về độ tự nhiên với độ trễ tương đương và có chất lượng tương đương ElevenLabs v3. Mô hình hỗ trợ điều chỉnh giọng nói zero-shot trong cùng một ngôn ngữ cũng như đa ngôn ngữ (ví dụ: giọng Pháp trong lời nói tiếng Anh). Kiến trúc bao gồm bộ giải mã transformer 3,4 tỷ tham số, transformer âm thanh (390 triệu) và bộ mã hóa âm thanh thần kinh tự phát triển (300 triệu). Để tinh chỉnh cho một giọng nói cụ thể, chỉ cần mẫu âm thanh dài từ 3 giây. Mô hình có sẵn qua API (từ 0,016 USD mỗi 1.000 ký tự) và trên Mistral Studio, cũng như dưới dạng trọng số mở trên Hugging Face theo giấy phép CC BY NC 4.0.
Nguồn: Mistral AI —
bản gốc
