MallitAvoin lähdekoodi 🇺🇸 24.07.2026 00:05

Vuoden 2026 parhaat avoimen lähdekoodin ASR-mallit: WER, kielet, viive ja lisenssit vertailussa

CohereCohere IBMIBM NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral KyutaiKyutai MetaMeta OpenAIOpenAI
Avoimen puheentunnistuksen (ASR:n) markkinat eivät ole enää yksinomaan Whisperin hallitsemat: viimeisten 12 kuukauden aikana on ilmestynyt monia kilpailevia malleja. Open ASR -johtotaulukon kärkipään mallit eroavat toisistaan alle prosenttiyksikön verran sanavirheprosentissa (WER), joten ratkaiseviksi tekijöiksi ovat nousseet lisenssi, kielikattavuus, suoratoiston tuki ja kustannus äänituntia kohden. Artikkeli vertailee päämalleja yksityiskohtaisesti näiden parametrien suhteen ja antaa suosituksia valintaan.
Viimeisten 12 kuukauden aikana avoimen puheentunnistuksen (ASR) markkinoista on tullut muutakin kuin Whisperin yksinvaltaa. Maaliskuussa 2026 Cohere julkaisi Transcribe-mallin (2 miljardia parametria, Apache 2.0), joka nousi Hugging Facen Open ASR Leaderboard -listan kärkeen keskimääräisellä sanavirhesuhteella (Word Error Rate, WER) 5,42 %. Viisi viikkoa myöhemmin IBM julkaisi Granite Speech 4.1 2B -mallin tuloksella 5,33 %, ja tämän jälkeen ARK-ASR-3B ja MOSS-Transcribe-preview-2B saavuttivat vieläkin matalampia lukemia. Listan kärkimalleja erottaa nyt alle yksi prosenttiyksikkö WER:ssä, mikä tekee listan sijoituksesta vain yhden valintakriteerin. Tärkeitä ovat lisenssi, kielikattavuus, suoratoistotuki ja hinta per äänitunti. Artikkelissa todetaan, että listan keskimääräinen WER ei ole kiinteä luku, sillä malleja on testattu eri tietojoukoilla. Esimerkiksi Coheren Transcribe sai 5,42 % kahdeksalla englanninkielisellä testijoukolla, kuten TED-LIUM, kun taas ARK-ASR-3B sai 5,04 % seitsemällä joukolla ilman TED-LIUMia, mikä nostaa sen keskiarvoa. Jos Coheren lasketaan uudelleen samoilla seitsemällä joukolla, sen WER on 5,84 % ja Granite Speech 4.1 2B:n 5,65 %. Jotkin mallit, kuten MOSS-Transcribe-preview-2B, on viimeistelty vahvistusoppimisella listan harjoitusosioilla, mikä nostaa niiden tuloksia. Appenin yksityiset testijoukot muuttavat järjestystä: niissä zoom/scribe_v1 nousee ykköseksi. Malleista erottuvat: Cohere Transcribe – 2B, Apache 2.0, 14 kieltä, ladattu yli 620 000 kertaa kuukaudessa; Granite Speech 4.1 2B – Apache 2.0, 6 kieltä, ASR + kaksisuuntainen puheenkäännös, RTFx 231,29; Canary-Qwen-2.5B – 2,5B, CC-BY-4.0, englanti, WER 5,63 %, RTFx 418; Qwen3-ASR-1.7B – Apache 2.0, 52 kieltä ja murretta, WER 5,76 %. Suorituskykyluokassa johtavat: Parakeet TDT 0.6B v3 (0,6B, CC-BY-4.0, RTFx 3332,74, 25 eurooppalaista kieltä, WER 6,32 %), Granite Speech 4.1 2B-NAR (ei-autoregressiivinen, RTFx ~1820) ja Qwen3-ASR-0.6B (52 kieltä, RTFx ~2000). Suoratoistoon: Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 kieltä, viive alkaen 80 ms, toimii 16 Gt:n GPU:lla) ja Kyutai STT (CC-BY-4.0, englanti/ranska, viive 0,5 s, sisäänrakennetulla semanttisella Voice Activity Detectionilla, VAD). Meta Omnilingual ASR (Apache 2.0) tukee yli 1600 kieltä natiivisti ja jopa yli 5400 kieltä zero-shot-oppimisen avulla. Whisper large-v3 (MIT, 99 kieltä) on edelleen paras valinta projekteihin, joissa minimilisenssikuormitus on tärkeää. Tutkimusuuutuuksia: diffusion-gemma-asr-small (rinnakkainen diffuusio-kohinanpoistogenerointi, 42 miljoonaa koulutettua parametria) ja MOSS-Transcribe-Diarize 0.9B (Apache 2.0, yli 50 kieltä, suorittaa tunnistuksen ja diarisoinnin yhdellä kertaa). Lisenssijako: Apache 2.0 (Cohere Transcribe, Granite Speech, Qwen3-ASR, Voxtral Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe), MIT (Whisper large-v3) ja CC-BY-4.0 (Canary-Qwen, Parakeet, Kyutai STT). Meta jakaa lisenssit: Apache 2.0 malleille, CC-BY korpukselle. Suositellaan valitsemaan malli seuraavassa järjestyksessä: lisenssi, kielikattavuus, suoratoisto- tai erätila, sitten WER-mittaus omilla äänidatoilla ja hinta per äänitunti omalla laitteistolla. Pääpäätelmä: avoin malli, jossa on 2 miljardia parametria permissiivisellä lisenssillä, ylittää nyt sen, mitä suljetut sovellusrajapinnat (API:t) tarjosivat 18 kuukautta sitten, ja valinta on pikemminkin hankintapäätös kuin tutkimuspäätös.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset