ميسترال إيه آي تطلق فوإكسترال تي تي إس، نموذج تركيب كلام متعدد اللغات
Mistral
ElevenLabs
أصدرت شركة ميسترال إيه آي نموذج فوإكسترال تي تي إس للتحويل من نص إلى كلام، وهو نموذج يضم 4 مليارات معلمة، ويقدم كلامًا واقعيًا معبرًا عاطفيًا بتسع لغات مع زمن استجابة منخفض وسهولة في تكييف الصوت. وهو متاح عبر واجهة برمجة التطبيقات واستوديو ميسترال، بدءًا من 0.016 دولار لكل 1000 حرف.
أعلنت شركة Mistral AI عن إطلاق نموذج Voxtral TTS، وهو أول نموذج لتحويل النص إلى كلام لديها يضم 4 مليارات معلمة، ويقدم توليدًا صوتيًا متعدد اللغات فائق الجودة. يدعم النموذج 9 لغات: الإنجليزية والفرنسية والألمانية والإسبانية والهولندية والبرتغالية والإيطالية والهندية والعربية. يتميز بزمن استجابة منخفض (70 مللي ثانية)، وتكييف صوتي عبر اللغات دون الحاجة إلى تدريب مسبق، وفهم سياقي للتعبير العاطفي. يتطلب التكييف الصوتي 3 ثوانٍ فقط من الصوت المرجعي. أظهرت التقييمات البشرية طبيعية فائقة مقارنة بـ ElevenLabs Flash v2.5 مع مضاهاة جودة ElevenLabs v3. تشمل البنية نواة محول (ترانسفورمر) بقدرة 3.4 مليار معلمة، ومحول صوتي تدفقي بقدرة 390 مليون معلمة، ومشفر صوت عصبي بقدرة 300 مليون معلمة. متاح عبر واجهة برمجة التطبيقات (API) بسعر 0.016 دولار لكل 1000 حرف، وفي استوديو Mistral. جزء من أوزان النموذج متاح على Hugging Face بموجب ترخيص CC BY NC 4.0.
المصدر: Mistral AI —
الأصلي
