ModelleOpen Source 🇺🇸 27.07.2026 16:05

Mistral AI veröffentlicht Voxtral Transcribe 2 — Modelle zur Spracherkennung mit extrem niedriger Latenz

MistralMistral Mistral AIMistral AI
Mistral KI hat Voxtral Transcribe 2 veröffentlicht, eine Familie von Sprach-zu-Text-Modellen, darunter Voxtral Mini Transcribe V2 für Stapeltranskription und Voxtral Realtime für Live-Anwendungen mit einer Latenz unter 200 Millisekunden. Voxtral Realtime ist unter der Apache-2.0-Lizenz mit offenen Gewichten verfügbar. Beide Modelle unterstützen 13 Sprachen und bieten eine hochmoderne Transkriptionsqualität mit Sprecher-Diarisierung.
Mistral AI hat Voxtral Transcribe 2 veröffentlicht, eine Familie von Spracherkennungsmodellen der nächsten Generation. Sie umfasst Voxtral Mini Transcribe V2 für die Stapeltranskription und Voxtral Realtime für die Live-Transkription mit konfigurierbaren Latenzen bis unter 200 ms. Voxtral Realtime hat offene Gewichte unter der Apache-2.0-Lizenz. Beide Modelle unterstützen 13 Sprachen: Englisch, Chinesisch, Hindi, Spanisch, Arabisch, Französisch, Portugiesisch, Russisch, Deutsch, Japanisch, Koreanisch, Italienisch und Niederländisch. Voxtral Mini Transcribe V2 erreicht eine Wortfehlerrate von etwa 4 % auf dem FLEURS-Benchmark bei 0,003 US-Dollar pro Minute und übertrifft damit Wettbewerber wie GPT-4o mini Transcribe und Gemini 2.5 Flash. Es bietet zudem Sprecherdiarisierung, Kontextgewichtung, Wort-Zeitstempel, Rauschrobustheit und unterstützt Audiodateien von bis zu 3 Stunden Länge. Voxtral Realtime mit einem Umfang von 4 Milliarden Parametern läuft effizient auf Edge-Geräten und liefert selbst bei einer Verzögerung von 480 ms eine nahezu offline-ähnliche Genauigkeit. Mistral hat außerdem einen Audio-Playground in Mistral Studio eingeführt, um die Transkription mit Diarisierung und Zeitstempeln zu testen.
Quelle: Mistral AI — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten