ModellenOpen Source 🇺🇸 24.07.2026 00:05

Best Open ASR Models of 2026: WER, Languages, Latency and Licenses Compared

CohereCohere IBMIBM NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral KyutaiKyutai MetaMeta OpenAIOpenAI
The open speech recognition (ASR) market is no longer a monoculture of Whisper: over the past 12 months, many competitive models have emerged. The leaders of the Open ASR Leaderboard are separated by less than one percentage point in WER, so the decisive factors have become license, language coverage, streaming support, and cost per hour of audio. The article compares the main models in detail across these parameters and provides recommendations for selection.
За последние 12 месяцев рынок открытого распознавания речи (ASR) перестал быть монокультурой Whisper. В марте 2026 года Cohere выпустила Transcribe (2B параметров, Apache 2.0), который возглавил рейтинг Open ASR Leaderboard на Hugging Face со средним показателем WER 5,42%. Пять недель спустя IBM выпустила Granite Speech 4.1 2B с результатом 5,33%, а затем ARK-ASR-3B и MOSS-Transcribe-preview-2B показали ещё более низкие значения. Лидеров рейтинга теперь разделяет менее одного процентного пункта по WER, что делает рейтинг не единственным критерием выбора. Важны лицензия, языковое покрытие, поддержка потоковой передачи и стоимость за час аудио. В статье отмечается, что средний показатель WER на лидерборде не является фиксированной величиной: модели тестировались на разных наборах данных. Например, Cohere Transcribe показал 5,42% на восьми английских тестовых наборах, включая TED-LIUM, а ARK-ASR-3B — 5,04% на семи наборах без TED-LIUM, что завышает его средний показатель. Если пересчитать Cohere по тем же семи наборам, его WER составит 5,84%, а Granite Speech 4.1 2B — 5,65%. Некоторые модели, как MOSS-Transcribe-preview-2B, были дообучены с подкреплением на тренировочных разделах лидерборда, что завышает их результаты. Приватные тестовые наборы от Appen меняют порядок в рейтинге: на них zoom/scribe_v1 выходит на первое место. Среди моделей выделяются: Cohere Transcribe — 2B, Apache 2.0, 14 языков, загружен более 620 000 раз за месяц; Granite Speech 4.1 2B — Apache 2.0, 6 языков, ASR + двунаправленный перевод речи, RTFx 231,29; Canary-Qwen-2.5B — 2,5B, CC-BY-4.0, английский, WER 5,63%, RTFx 418; Qwen3-ASR-1.7B — Apache 2.0, 52 языка и диалекта, WER 5,76%. В категории пропускной способности лидируют: Parakeet TDT 0.6B v3 (0,6B, CC-BY-4.0, RTFx 3332,74, 25 европейских языков, WER 6,32%), Granite Speech 4.1 2B-NAR (неавторегрессионная, RTFx ~1820) и Qwen3-ASR-0.6B (52 языка, RTFx ~2000). Для потоковой передачи: Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 языков, задержка от 80 мс, работает на 16 ГБ GPU) и Kyutai STT (CC-BY-4.0, английский/французский, задержка 0,5 с, со встроенным семантическим VAD). Meta Omnilingual ASR (Apache 2.0) поддерживает 1600+ языков нативно и до 5400+ через zero-shot обучение. Whisper large-v3 (MIT, 99 языков) остаётся лучшим выбором для проектов, где важна минимальная лицензионная обременённость. Среди исследовательских новинок: diffusion-gemma-asr-small (параллельная диффузионная денойзинг-генерация, 42M обученных параметров) и MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ языков, выполняет распознавание и диаризацию за один проход). Лицензионное разделение: Apache 2.0 (Cohere Transcribe, Granite Speech, Qwen3-ASR, Voxtral Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe), MIT (Whisper large-v3) и CC-BY-4.0 (Canary-Qwen, Parakeet, Kyutai STT). Meta разделяет лицензии: Apache 2.0 для моделей, CC-BY для корпуса. Рекомендуется выбирать модель в следующем порядке: лицензия, языковое покрытие, потоковый или пакетный режим, затем измерение WER на собственных аудиоданных и расчёт стоимости за час аудио на своём оборудовании. Главный вывод: открытая модель с 2B параметров на пермиссивной лицензии теперь превосходит то, что закрытые API предлагали 18 месяцев назад, и выбор сводится к закупочному решению, а не исследовательскому.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws