Лучшие открытые ASR-модели 2026 года: сравнение WER, языков, задержки и лицензий
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
Рынок открытого распознавания речи (ASR) перестал быть монокультурой Whisper: за последние 12 месяцев появилось множество конкурентоспособных моделей. Лидеры Open ASR Leaderboard разделяет менее одного процентного пункта по WER, поэтому решающими факторами стали лицензия, языковое покрытие, поддержка потоковой передачи и стоимость за час аудио. В статье подробно сравниваются основные модели по этим параметрам, даются рекомендации по выбору.
За последние 12 месяцев рынок открытого распознавания речи (ASR) перестал быть монокультурой Whisper. В марте 2026 года Cohere выпустила Transcribe (2B параметров, Apache 2.0), который возглавил рейтинг Open ASR Leaderboard на Hugging Face со средним показателем WER 5,42%. Пять недель спустя IBM выпустила Granite Speech 4.1 2B с результатом 5,33%, а затем ARK-ASR-3B и MOSS-Transcribe-preview-2B
Показать ещё ↓
- Сокращения
- ASR = Automatic Speech Recognition — автоматическое распознавание речи
- WER = Word Error Rate — процент словесных ошибок
- CER = Character Error Rate — процент символьных ошибок
- VAD = Voice Activity Detection — обнаружение голосовой активности
- RTF = Real-Time Factor — коэффициент реального времени
- LLM = Large Language Model — большая языковая модель
- CTC = Connectionist Temporal Classification — коннекционистская временная классификация
- GPU = Graphics Processing Unit — графический процессор
Источник: MarkTechPost —
оригинал
