मीडिया निर्माण 🇺🇸 27.07.2026 15:06

Mistral AI ने Voxtral TTS लॉन्च किया, एक बहुभाषी वाक् संश्लेषण मॉडल

MistralMistral ElevenLabsElevenLabs
Mistral AI ने Voxtral TTS जारी किया, जो 4 अरब पैरामीटर का टेक्स्ट-टू-स्पीच मॉडल है जो कम विलंबता और आसान आवाज अनुकूलन के साथ 9 भाषाओं में यथार्थवादी, भावनात्मक रूप से अभिव्यंजक वाक् प्रदान करता है। यह API और Mistral Studio के माध्यम से उपलब्ध है, जिसकी कीमत $0.016 प्रति 1,000 वर्ण से शुरू होती है।
Mistral AI ने अपना पहला टेक्स्ट-टू-स्पीच मॉडल Voxtral TTS पेश किया, जिसमें 4 बिलियन पैरामीटर हैं और यह अत्याधुनिक बहुभाषी वॉइस जनरेशन प्रदान करता है। यह मॉडल 9 भाषाओं का समर्थन करता है: अंग्रेज़ी, फ्रेंच, जर्मन, स्पेनिश, डच, पुर्तगाली, इटालियन, हिंदी और अरबी। इसमें कम विलंबता (70 मिलीसेकंड मॉडल विलंबता), शून्य-शॉट क्रॉस-लिंगुअल वॉइस एडाप्टेशन और भावनात्मक अभिव्यक्ति के लिए प्रासंगिक समझ है। वॉइस एडाप्टेशन के लिए केवल 3 सेकंड के रेफरेंस ऑडियो की आवश्यकता होती है। मानव मूल्यांकनों में ElevenLabs Flash v2.5 की तुलना में बेहतर स्वाभाविकता दिखी, जबकि ElevenLabs v3 की गुणवत्ता से मेल खाती है। आर्किटेक्चर में 3.4 बिलियन पैरामीटर का ट्रांसफॉर्मर डिकोडर बैकबोन, 390 मिलियन पैरामीटर का फ्लो-मैचिंग एकॉस्टिक ट्रांसफॉर्मर और 300 मिलियन पैरामीटर का न्यूरल ऑडियो कोडेक शामिल है। API के माध्यम से प्रति 1 हज़ार कैरेक्टर पर $0.016 की कीमत पर और Mistral Studio में उपलब्ध है। मॉडल वेट का एक हिस्सा Hugging Face पर CC BY NC 4.0 लाइसेंस के तहत ओपन है।
स्रोत: Mistral AI — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार