Vuoden 2026 parhaat avoimen lähdekoodin ASR-mallit: WER, kielet, viive ja lisenssit vertailussa
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
Avoimen puheentunnistuksen kenttä on monipuolistunut Whisperin jälkeen, ja useat mallit saavuttavat alle kuuden prosentin sanavirhesuhteen (WER) Open ASR -johtotaululla. Keskeisiä kehitysaskeleita ovat muun muassa Cohere Transcribe, IBM Granite Speech 4.1 sekä erilaiset mallit suorituskyvylle, suoratoistolle ja kielikattavuudelle. Raportti korostaa, että lisenssi, kielituki, suorituskyky ja suoratoistokyky ovat nykyään tärkeämpiä kuin pelkkä sijoitus johtotaululla.
Avoimen ASR:n kenttä on siirtynyt Whisper-monokulttuurin ohi. Maaliskuussa 2026 Cohere julkaisi Transcribe-mallin (2B, Apache 2.0), jonka keskimääräinen sanavirhesuhde on 5,42 prosenttia, ja IBM:n Granite Speech 4.1 2B seurasi 5,33 prosentilla. ARK-ASR-3B ja MOSS-Transcribe-preview-2B raportoivat myöhemmin vielä pienempiä lukuja. Johtajataulukon tulokset eivät kuitenkaan ole suoraan vertailukelpoisia erilaisten testiaineistokoostumusten vuoksi; Coheren tulos laskee 5,42 prosentista 5,84 prosenttiin, kun se lasketaan uudelleen samoilla seitsemällä aineistolla kuin ARK. Appenin yksityiset arviointiaineistot muuttavat järjestystä edelleen. Cohere Transcribe omaa vahvan tuotantotuen ja inhimillisten mieltymysten voittoja. IBM Granite Speech 4.1 tarjoaa enemmän ominaisuuksia, kuten avainsanojen painotuksen ja välimerkityksen. Canary-Qwen-2.5B toimii joko transkriptio- tai kielimallitilassa. Qwen3-ASR kattaa 52 kieltä. Suorituskyvyssä Parakeet TDT 0.6B v3 johtaa nopeudella RTFx 3332,74, kun taas Granite Speech 4.2B-NAR on ei-autoregressiivinen. Suoratoistossa Voxtral Mini 4B Realtime ja Kyutai STT tarjoavat matalaa viivettä. Metan Omnilingual ASR kattaa yli 1600 kieltä. Whisper large-v3 on edelleen olennainen MIT-lisenssinsä ja ekosysteeminsä ansiosta. Interfazen diffusion-gemma-asr-malli on arkkitehtuuriltaan uusi, mutta ei käyttöönottokelpoinen. MOSS-Transcribe-Diarize yhdistää puhujien tunnisteet. Lisenssivalinnat jakautuvat: Apache 2.0 (Cohere, IBM, Qwen), MIT (Whisper), CC-BY-4.0 (Canary, Parakeet, Kyutai). Tiimejä suositellaan arvioimaan lisenssin, kielikattavuuden, suoratoiston ja eräajon, oman äänen sanavirhesuhteen sekä kustannusten perusteella äänituntia kohden.
Lähde: MarkTechPost —
Alkuperäinen
