Mistral AI, Voxtral Transcribe 2'yi Yayınladı — Ultra Düşük Gecikmeli Konuşma Tanıma Modelleri
Mistral
Mistral AI
Mistral AI, Voxtral Transcribe 2'yi piyasaya sürdü. Bu bir konuşmadan metne model ailesi olan Voxtral Mini Transcribe V2 (toplu transkripsiyon için) ve Voxtral Realtime'ı (200 milisaniyenin altında gecikmeyle canlı uygulamalar için) içeriyor. Voxtral Realtime, Apache 2.0 altında açık ağırlıklara sahiptir. Her iki model de 13 dili destekler ve konuşmacı diyarizasyonu ile son teknoloji transkripsiyon kalitesi sunar.
Mistral AI, Voxtral Transcribe 2 adlı yeni nesil bir konuşmadan metne model ailesini yayınladı. Bu aile, toplu döküm için Voxtral Mini Transcribe V2 ve 200 milisaniyenin altına kadar yapılandırılabilir gecikmeyle canlı döküm sağlayan Voxtral Realtime modellerini içeriyor. Voxtral Realtime, Apache 2.0 lisansı altında açık ağırlıklara sahip. Her iki model de 13 dili destekliyor: İngilizce, Çince (Mandarin), Hintçe, İspanyolca, Arapça, Fransızca, Portekizce, Rusça, Almanca, Japonca, Korece, İtalyanca ve Felemenkçe. Voxtral Mini Transcribe V2, FLEURS kıyaslamasında dakika başına 0,003 dolar maliyetle yaklaşık %4 kelime hatası oranı elde ederek GPT-4o mini Transcribe ve Gemini 2.5 Flash gibi rakiplerini geride bırakıyor. Ayrıca konuşmacı diyarlaştırması, bağlam yönlendirme, kelime düzeyinde zaman damgaları, gürültü dayanıklılığı sunuyor ve 3 saate kadar ses desteği sağlıyor. 4 milyar parametre büyüklüğündeki Voxtral Realtime, uç cihazlarda verimli bir şekilde çalışıyor ve 480 milisaniyelik gecikmede bile çevrimdışı benzeri doğruluk sağlıyor. Mistral ayrıca, diyarlaştırma ve zaman damgalarıyla döküm testi için Mistral Studio'da bir ses oynatma alanı başlattı.
Kaynak: Mistral AI —
orijinal
