Top Mô Hình ASR Mở Năm 2026: So Sánh WER, Ngôn Ngữ, Độ Trễ và Giấy Phép
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
Bức tranh nhận dạng giọng nói mã nguồn mở đã đa dạng hóa vượt ra ngoài Whisper, với nhiều mô hình đạt tỷ lệ lỗi từ (WER) dưới 6% trên Bảng xếp hạng ASR Mở. Các phát triển chính bao gồm Cohere Transcribe, IBM Granite Speech 4.1, và nhiều mô hình khác tập trung vào thông lượng, phát trực tiếp và độ phủ ngôn ngữ. Báo cáo nhấn mạnh rằng giấy phép, hỗ trợ ngôn ngữ, thông lượng và khả năng phát trực tiếp hiện quan trọng hơn thứ hạng thô trên bảng xếp hạng.
Lĩnh vực nhận dạng giọng nói tự động (ASR) mã nguồn mở đã vượt qua thời kỳ độc tôn của Whisper. Vào tháng 3 năm 2026, Cohere ra mắt Transcribe (2B, Apache 2.0) với tỷ lệ lỗi từ (WER) trung bình 5,42%, tiếp theo là Granite Speech 4.1 2B của IBM với 5,33%. ARK-ASR-3B và MOSS-Transcribe-preview-2B sau đó công bố các con số thấp hơn. Tuy nhiên, điểm số trên bảng xếp hạng không thể so sánh trực tiếp do các bộ test có thành phần khác nhau; điểm của Cohere giảm từ 5,42% xuống 5,84% khi tính lại trên cùng bảy bộ test như ARK. Các bộ đánh giá riêng tư từ Appen còn làm thay đổi thứ tự xếp hạng. Cohere Transcribe có hỗ trợ sản xuất mạnh mẽ và chiến thắng về sở thích của con người. IBM Granite Speech 4.1 cung cấp nhiều tính năng hơn như từ khóa ưu tiên (keyword biasing) và dấu câu. Canary-Qwen-2.5B chạy ở chế độ phiên âm hoặc chế độ LLM. Qwen3-ASR hỗ trợ 52 ngôn ngữ. Về thông lượng, Parakeet TDT 0.6B v3 dẫn đầu với RTFx 3332,74, trong khi Granite Speech 4.2B-NAR là phi tự hồi quy (non-autoregressive). Về luồng thời gian thực (streaming), Voxtral Mini 4B Realtime và Kyutai STT cung cấp độ trễ thấp. Omnilingual ASR của Meta hỗ trợ hơn 1600 ngôn ngữ. Whisper large-v3 vẫn phù hợp nhờ giấy phép MIT và hệ sinh thái. Mô hình diffusion-gemma-asr từ Interfaze mang tính đột phá về kiến trúc nhưng không thể triển khai. MOSS-Transcribe-Diarize tích hợp nhãn người nói. Các lựa chọn giấy phép phân chia: Apache 2.0 (Cohere, IBM, Qwen), MIT (Whisper), CC-BY-4.0 (Canary, Parakeet, Kyutai). Các nhóm được khuyên nên đánh giá dựa trên giấy phép, phạm vi ngôn ngữ, luồng thời gian thực so với xử lý theo lô, WER trên dữ liệu âm thanh của chính họ và chi phí mỗi giờ âm thanh.
Nguồn: MarkTechPost —
bản gốc
