показали ещё более низкие значения. Лидеров рейтинга теперь разделяет менее одного процентного пункта по WER, что делает рейтинг не единственным критерием выбора. Важны лицензия, языковое покрытие, поддержка потоковой передачи и стоимость за час аудио. В статье отмечается, что средний показатель WER на лидерборде не является фиксированной величиной: модели тестировались на разных наборах данных. Например, Cohere Transcribe показал 5,42% на восьми английских тестовых наборах, включая TED-LIUM, а ARK-ASR-3B — 5,04% на семи наборах без TED-LIUM, что завышает его средний показатель. Если пересчитать Cohere по тем же семи наборам, его WER составит 5,84%, а Granite Speech 4.1 2B — 5,65%. Некоторые модели, как MOSS-Transcribe-preview-2B, были дообучены с подкреплением на тренировочных разделах лидерборда, что завышает их результаты. Приватные тестовые наборы от Appen меняют порядок в рейтинге: на них zoom/scribe_v1 выходит на первое место. Среди моделей выделяются: Cohere Transcribe — 2B, Apache 2.0, 14 языков, загружен более 620 000 раз за месяц; Granite Speech 4.1 2B — Apache 2.0, 6 языков, ASR + двунаправленный перевод речи, RTFx 231,29; Canary-Qwen-2.5B — 2,5B, CC-BY-4.0, английский, WER 5,63%, RTFx 418; Qwen3-ASR-1.7B — Apache 2.0, 52 языка и диалекта, WER 5,76%. В категории пропускной способности лидируют: Parakeet TDT 0.6B v3 (0,6B, CC-BY-4.0, RTFx 3332,74, 25 европейских языков, WER 6,32%), Granite Speech 4.1 2B-NAR (неавторегрессионная, RTFx ~1820) и Qwen3-ASR-0.6B (52 языка, RTFx ~2000). Для потоковой передачи: Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 языков, задержка от 80 мс, работает на 16 ГБ GPU) и Kyutai STT (CC-BY-4.0, английский/французский, задержка 0,5 с, со встроенным семантическим VAD). Meta Omnilingual ASR (Apache 2.0) поддерживает 1600+ языков
Показать ещё ↓