ModelSumber Terbuka 🇺🇸 24.07.2026 00:05

Model ASR Open Teratas 2026: Perbandingan WER, Bahasa, Latensi, dan Lisensi

CohereCohere IBMIBM NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral KyutaiKyutai MetaMeta OpenAIOpenAI
Lanskap pengenalan suara terbuka telah berdiversifikasi melampaui Whisper, dengan banyak model mencapai WER di bawah 6% di Papan Peringkat ASR Terbuka. Perkembangan utama meliputi Cohere Transcribe, IBM Granite Speech 4.1, dan berbagai model untuk throughput, streaming, dan cakupan bahasa. Laporan ini menekankan bahwa lisensi, dukungan bahasa, throughput, dan kemampuan streaming kini lebih penting daripada peringkat papan peringkat mentah.
Bidang ASR terbuka telah melampaui budaya monoculture Whisper. Pada Maret 2026, Cohere merilis Transcribe (2B, Apache 2.0) dengan rata-rata WER 5,42%, disusul oleh Granite Speech 4.1 2B dari IBM sebesar 5,33%. ARK-ASR-3B dan MOSS-Transcribe-preview-2B kemudian mencatat angka yang lebih rendah. Namun, skor papan peringkat tidak dapat dibandingkan secara langsung karena perbedaan komposisi set pengujian; skor Cohere turun dari 5,42% menjadi 5,84% ketika dihitung ulang pada tujuh set yang sama dengan ARK. Set evaluasi privat dari Appen semakin mengacak peringkat. Cohere Transcribe memiliki dukungan produksi yang kuat dan kemenangan preferensi manusia. IBM Granite Speech 4.1 menawarkan lebih banyak fitur seperti keyword biasing dan tanda baca. Canary-Qwen-2.5B berjalan dalam mode transkripsi atau mode LLM. Qwen3-ASR mencakup 52 bahasa. Dalam hal throughput, Parakeet TDT 0,6B v3 memimpin dengan RTFx 3332,74, sementara Granite Speech 4.2B-NAR bersifat non-autoregresif. Untuk streaming, Voxtral Mini 4B Realtime dan Kyutai STT menawarkan latensi rendah. Omnilingual ASR dari Meta mencakup lebih dari 1600 bahasa. Whisper large-v3 tetap relevan karena lisensi MIT dan ekosistemnya. Model diffusion-gemma-asr dari Interfaze inovatif secara arsitektural tetapi tidak dapat di-deploy. MOSS-Transcribe-Diarize mengintegrasikan label pembicara. Pilihan lisensi terbagi: Apache 2.0 (Cohere, IBM, Qwen), MIT (Whisper), CC-BY-4.0 (Canary, Parakeet, Kyutai). Tim disarankan untuk mengevaluasi berdasarkan lisensi, cakupan bahasa, streaming vs. batch, WER audio sendiri, dan biaya per jam audio.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru