Mistral AI ने लॉन्च किया Voxtral Transcribe 2 — अल्ट्रा-लो लेटेंसी स्पीच रिकॉग्निशन मॉडल्स
Mistral
Mistral AI
Mistral AI ने Voxtral Transcribe 2 लॉन्च किया है, जो स्पीच-टू-टेक्स्ट मॉडल्स का एक परिवार है, जिसमें बैच ट्रांसक्रिप्शन के लिए Voxtral Mini Transcribe V2 और लाइव एप्लिकेशन्स के लिए Voxtral Realtime शामिल है, जो 200 मिलीसेकंड से कम लेटेंसी प्रदान करता है। Voxtral Realtime Apache 2.0 के तहत ओपन-वेट है। दोनों मॉडल 13 भाषाओं का समर्थन करते हैं और स्पीकर डायराइजेशन के साथ अत्याधुनिक ट्रांसक्रिप्शन गुणवत्ता प्रदान करते हैं।
Mistral AI ने Voxtral Transcribe 2 जारी किया, जो अगली पीढ़ी का स्पीच-टू-टेक्स्ट मॉडल परिवार है। इसमें बैच ट्रांसक्रिप्शन के लिए Voxtral Mini Transcribe V2 और लाइव ट्रांसक्रिप्शन के लिए Voxtral Realtime शामिल है, जिसमें विलंबता (लेटेंसी) 200ms से कम तक कॉन्फ़िगर की जा सकती है। Voxtral Realtime Apache 2.0 लाइसेंस के तहत ओपन-वेट है। दोनों मॉडल 13 भाषाओं का समर्थन करते हैं: अंग्रेजी, चीनी, हिंदी, स्पेनिश, अरबी, फ्रेंच, पुर्तगाली, रूसी, जर्मन, जापानी, कोरियाई, इतालवी और डच। Voxtral Mini Transcribe V2 FLEURS बेंचमार्क पर लगभग 4% वर्ड एरर रेट (शब्द त्रुटि दर) प्राप्त करता है, जो $0.003 प्रति मिनट पर है, और GPT-4o mini Transcribe तथा Gemini 2.5 Flash जैसे प्रतिस्पर्धियों से बेहतर प्रदर्शन करता है। इसमें स्पीकर डायराइज़ेशन, कॉन्टेक्स्ट बायसिंग, वर्ड-लेवल टाइमस्टैम्प, शोर सहनशीलता (नॉइज़ रोबस्टनेस) और 3 घंटे तक के ऑडियो का समर्थन शामिल है। Voxtral Realtime, जिसका पैरामीटर साइज़ 4 अरब है, एज डिवाइसों पर कुशलतापूर्वक चलता है और 480ms विलंबता पर भी लगभग ऑफ़लाइन सटीकता प्रदान करता है। Mistral ने Mistral Studio में एक ऑडियो प्लेग्राउंड भी लॉन्च किया है, जो डायराइज़ेशन और टाइमस्टैम्प के साथ ट्रांसक्रिप्शन के परीक्षण के लिए है।
स्रोत: Mistral AI —
मूल
