Mistral AI Merilis Voxtral Transcribe 2 — Model Pengenalan Ucapan dengan Latensi Sangat Rendah
Mistral
Mistral AI
Mistral AI telah meluncurkan Voxtral Transcribe 2, sebuah keluarga model ucapan-ke-teks yang mencakup Voxtral Mini Transcribe V2 untuk transkripsi batch dan Voxtral Realtime untuk aplikasi langsung dengan latensi di bawah 200 ms. Voxtral Realtime dirilis dengan bobot terbuka di bawah lisensi Apache 2.0. Kedua model mendukung 13 bahasa dan menawarkan kualitas transkripsi terdepan dengan diarisasi pembicara.
Mistral AI merilis Voxtral Transcribe 2, keluarga model generasi baru untuk mengubah ucapan menjadi teks. Model ini mencakup Voxtral Mini Transcribe V2 untuk transkripsi batch dan Voxtral Realtime untuk transkripsi langsung dengan latensi yang dapat dikonfigurasi hingga di bawah 200 ms. Voxtral Realtime memiliki bobot terbuka di bawah lisensi Apache 2.0. Kedua model mendukung 13 bahasa: Inggris, Mandarin, Hindi, Spanyol, Arab, Prancis, Portugis, Rusia, Jerman, Jepang, Korea, Italia, dan Belanda. Voxtral Mini Transcribe V2 mencapai tingkat kesalahan kata sekitar empat persen pada tolok ukur FLEURS dengan biaya $0,003 per menit, mengungguli pesaing seperti GPT-4o mini Transcribe dan Gemini 2.5 Flash. Model ini juga memiliki fitur diarisasi pembicara, pembiasan konteks, stempel waktu level kata, ketahanan terhadap kebisingan, serta mendukung audio hingga 3 jam. Voxtral Realtime, dengan jejak parameter 4 miliar, berjalan efisien pada perangkat tepi dan memberikan akurasi mendekati luring bahkan pada penundaan 480 ms. Mistral juga meluncurkan taman bermain audio di Mistral Studio untuk menguji transkripsi dengan diarisasi dan stempel waktu.
Sumber: Mistral AI —
asli
