ميسترال إيه آي تطلق فوإكستريل TTS — نموذج جديد لتوليف الكلام متعدد اللغات
Mistral
ElevenLabs
أطلقت ميسترال إيه آي نموذج فوإكستريل TTS لتوليف الكلام، وهو نموذج يضم 4 مليارات معلمة ويدعم 9 لغات، مع قدرة على التعبير العاطفي وزمن انتقال منخفض وسهولة في تكييف الصوت. النموذج متاح عبر واجهة برمجة التطبيقات وميسترال ستوديو، بسعر يبدأ من 0.016 دولار لكل 1000 حرف.
أعلنت شركة ميت كول للذكاء الاصطناعي (Mistral AI) عن إطلاق نموذجها الأول لتركيب الكلام، Voxtral TTS، الذي يضم 4 مليارات معلمة. يتميز بقدرته على إنتاج كلام واقعي ومشحون عاطفياً بتسع لغات مع مراعاة اللهجات المحلية، مع زمن استجابة منخفض (70 ملّي ثانية للعينة النموذجية)، وسهولة التكيف مع أصوات جديدة. يتفوق النموذج على ElevenLabs Flash v2.5 من حيث الطبيعية مع زمن استجابة مماثل، ويكافئ ElevenLabs v3 من حيث الجودة. يدعم Voxtral TTS التكيف الصوتي في وضع الصفر عينة (zero-shot) داخل اللغة الواحدة وعبر اللغات (مثلاً نطق فرنسي في كلام إنجليزي). تتضمن البنية معالجاً تفاضلياً (transformer decoder) يحوي 3.4 مليار معلمة، ومحولاً صوتياً (acoustic transformer) بحجم 390 مليون معلمة، ومشفراً عصبياً صوتياً (neural audio codec) بحجم 300 مليون معلمة من تطوير الشركة الخاص. لتخصيص الصوت يكفي تقديم عينة لا تقل مدتها عن 3 ثوانٍ. يتوفر النموذج عبر واجهة برمجة التطبيقات (API) بسعر يبدأ من 0.016 دولار لكل ألف رمز، وفي منصة Mistral Studio، كما يتوفر بأوزان مفتوحة على Hugging Face تحت رخصة المشاع الإبداعي غير التجاري (CC BY NC 4.0).
المصدر: Mistral AI —
الأصلي
