2026년 최고의 오픈 ASR 모델: WER, 언어, 지연 시간 및 라이선스 비교
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
오픈 음성 인식 환경은 Whisper를 넘어 다양해졌으며, 여러 모델이 Open ASR 리더보드에서 6% 미만의 WER을 달성했습니다. 주요 개발 사항으로는 Cohere Transcribe, IBM Granite Speech 4.1 및 처리량, 스트리밍, 언어 커버리지를 위한 다양한 모델이 있습니다. 보고서는 원시 리더보드 순위보다 라이선스, 언어 지원, 처리량 및 스트리밍 기능이 더 중요하다고 강조합니다.
오픈 ASR 분야는 Whisper 독점 시대를 넘어섰습니다. 2026년 3월, Cohere는 평균 WER 5.42%를 기록한 Transcribe(2B, Apache 2.0)를 출시했으며, 이어 IBM의 Granite Speech 4.1 2B가 5.33%를 기록했습니다. 이후 ARK-ASR-3B와 MOSS-Transcribe-preview-2B가 더 낮은 수치를 보였습니다. 그러나 리더보드 점수는 테스트 세트 구성이 달라 직접 비교하기 어렵습니다. Cohere의 점수는 ARK와 동일한 7개 세트로 재계산하면 5.42%에서 5.84%로 떨어집니다. Appen의 비공개 평가 세트에서는 순위가 더욱 바뀝니다. Cohere Transcribe는 강력한 프로덕션 지원과 사람의 선호도 우위를 자랑합니다. IBM Granite Speech 4.1은 키워드 편향 및 구두점과 같은 더 많은 기능을 제공합니다. Canary-Qwen-2.5B는 전사 모드 또는 LLM 모드로 실행됩니다. Qwen3-ASR은 52개 언어를 지원합니다. 처리량 측면에서 Parakeet TDT 0.6B v3는 RTFx 3332.74로 선두를 달리고, Granite Speech 4.2B-NAR는 비자기회귀 모델입니다. 스트리밍의 경우 Voxtral Mini 4B Realtime과 Kyutai STT가 낮은 지연 시간을 제공합니다. Meta의 Omnilingual ASR은 1600개 이상의 언어를 지원합니다. Whisper large-v3는 MIT 라이선스와 생태계 덕분에 여전히 유효합니다. Interfaze의 diffusion-gemma-asr 모델은 구조적으로 참신하지만 배포가 불가능합니다. MOSS-Transcribe-Diarize는 화자 레이블을 통합합니다. 라이선스 선택은 Apache 2.0(Cohere, IBM, Qwen), MIT(Whisper), CC-BY-4.0(Canary, Parakeet, Kyutai)으로 나뉩니다. 팀은 라이선스, 언어 지원 범위, 스트리밍 대 배치, 자체 오디오 WER, 오디오 시간당 비용을 기준으로 평가하는 것이 좋습니다.
출처: MarkTechPost —
원문
