нативно и до 5400+ через zero-shot обучение. Whisper large-v3 (MIT, 99 языков) остаётся лучшим выбором для проектов, где важна минимальная лицензионная обременённость. Среди исследовательских новинок: diffusion-gemma-asr-small (параллельная диффузионная денойзинг-генерация, 42M обученных параметров) и MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ языков, выполняет распознавание и диаризацию за один проход). Лицензионное разделение: Apache 2.0 (Cohere Transcribe, Granite Speech, Qwen3-ASR, Voxtral Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe), MIT (Whisper large-v3) и CC-BY-4.0 (Canary-Qwen, Parakeet, Kyutai STT). Meta разделяет лицензии: Apache 2.0 для моделей, CC-BY для корпуса. Рекомендуется выбирать модель в следующем порядке: лицензия, языковое покрытие, потоковый или пакетный режим, затем измерение WER на собственных аудиоданных и расчёт стоимости за час аудио на своём оборудовании. Главный вывод: открытая модель с 2B параметров на пермиссивной лицензии теперь превосходит то, что закрытые API предлагали 18 месяцев назад, и выбор сводится к закупочному решению, а не исследовательскому.