ModelleOpen Source 🇺🇸 24.07.2026 00:05

Top Open ASR Modelle 2026: WER, Sprachen, Latenz und Lizenzvergleich

CohereCohere IBMIBM NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral KyutaiKyutai MetaMeta OpenAIOpenAI
Die Open-Speech-Recognition-Landschaft hat sich über Whisper hinaus diversifiziert: Mehrere Modelle erreichen eine Wortfehlerrate unter 6 % auf dem Open ASR Leaderboard. Zu den wichtigsten Entwicklungen gehören Cohere Transcribe, IBM Granite Speech 4.1 und verschiedene Modelle mit Fokus auf Durchsatz, Streaming und Sprachabdeckung. Der Bericht betont, dass Lizenz, Sprachunterstützung, Durchsatz und Streaming-Fähigkeit heute wichtiger sind als die reine Leaderboard-Position.
Das offene ASR-Feld hat die Whisper-Monokultur hinter sich gelassen. Im März 2026 veröffentlichte Cohere Transcribe (2B, Apache 2.0) mit einer durchschnittlichen Wortfehlerrate (Word Error Rate, WER) von 5,42 %, gefolgt von IBM Granite Speech 4.1 2B mit 5,33 %. ARK-ASR-3B und MOSS-Transcribe-preview-2B erzielten später niedrigere Werte. Die Bestenlistenpunkte sind jedoch aufgrund unterschiedlicher Testset-Zusammensetzungen nicht direkt vergleichbar; Coheres Punktzahl sinkt von 5,42 % auf 5,84 %, wenn sie auf denselben sieben Datensätzen wie ARK neu berechnet wird. Private Bewertungssets von Appen führen zu einer weiteren Umordnung der Rangfolgen. Cohere Transcribe bietet starken Produktionssupport und gewinnt bei menschlichen Präferenzen. IBM Granite Speech 4.1 bietet mehr Funktionen wie Schlagwortausrichtung (Keyword Biasing) und Interpunktion. Canary-Qwen-2.5B kann im Transkriptions- oder LLM-Modus ausgeführt werden. Qwen3-ASR deckt 52 Sprachen ab. Bei der Durchsatzleistung liegt Parakeet TDT 0.6B v3 mit RTFx 3332,74 an der Spitze, während Granite Speech 4.2B-NAR nicht-autoregressiv ist. Für Streaming bieten Voxtral Mini 4B Realtime und Kyutai STT eine niedrige Latenz. Metas Omnilingual ASR deckt über 1600 Sprachen ab. Whisper large-v3 bleibt aufgrund seiner MIT-Lizenz und des Ökosystems relevant. Das Modell diffusion-gemma-asr von Interfaze ist architektonisch neuartig, aber nicht einsetzbar. MOSS-Transcribe-Diarize integriert Sprecherlabel. Die Lizenzwahl spaltet sich: Apache 2.0 (Cohere, IBM, Qwen), MIT (Whisper), CC-BY-4.0 (Canary, Parakeet, Kyutai). Teams wird empfohlen, basierend auf Lizenz, Sprachabdeckung, Streaming vs. Stapelverarbeitung, eigener Audio-WER und Kosten pro Audiostunde zu evaluieren.
Quelle: MarkTechPost — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten