ModelleOpen Source 🇺🇸 27.07.2026 16:05

Mistral AI veröffentlicht Voxtral Transcribe 2 – Modelle für Spracherkennung mit extrem niedriger Latenz

MistralMistral Mistral AIMistral AI
Mistral AI hat die Modellfamilie Voxtral Transcribe 2 vorgestellt, darunter Voxtral Mini Transcribe V2 für Batch-Transkription und Voxtral Realtime für Live-Anwendungen. Voxtral Realtime wird mit offenen Gewichten unter der Apache-2.0-Lizenz verbreitet. Die Modelle unterstützen 13 Sprachen, Diarisierung und kontextuelle Steuerung, während Voxtral Mini Transcribe V2 niedrige Kosten (0,003 US-Dollar pro Minute) und hohe Genauigkeit bietet.
Mistral AI hat die Veröffentlichung von Voxtral Transcribe 2 angekündigt, zwei neuen Spracherkennungsmodellen, die auf hohe Transkriptionsqualität, Diarisierung und minimale Latenz ausgelegt sind. Die Familie umfasst Voxtral Mini Transcribe V2 für die Batch-Verarbeitung und Voxtral Realtime für Live-Anwendungen. Voxtral Realtime verwendet eine neue Streaming-Architektur, die Audio verarbeitet, während es eingeht, und ermöglicht eine anpassbare Latenz von unter 200 Millisekunden. Das Modell hat 4 Milliarden Parameter, unterstützt 13 Sprachen (darunter Englisch, Chinesisch, Hindi, Spanisch, Arabisch, Französisch, Portugiesisch, Russisch, Deutsch, Japanisch, Koreanisch, Italienisch und Niederländisch) und wird mit offenen Gewichten unter der Apache-2.0-Lizenz auf dem Hugging Face Hub veröffentlicht. Voxtral Mini Transcribe V2 erreicht eine Fehlerrate von etwa 4 Prozent auf FLEURS und kostet 0,003 US-Dollar pro Minute – laut Unternehmen das beste Preis-Leistungs-Verhältnis unter den Transkriptions-APIs. Das Modell übertrifft GPT-4o Mini Transcribe, Gemini 2.5 Flash, Assembly Universal und Deepgram Nova in der Genauigkeit, verarbeitet Audio etwa dreimal schneller als ElevenLabs Scribe v2 bei gleicher Genauigkeit und ist fünfmal günstiger. Voxtral Mini Transcribe V2 unterstützt Diarisierung (Erstellung von Sprecherlabels mit genauen Start- und Endzeiten), kontextuelles Management (bis zu 100 Wörter zur Korrektur der Schreibweise), sekundengenaue Zeitstempel, Rauschunempfindlichkeit, Audioverarbeitung von bis zu 3 Stunden und dieselben 13 Sprachen. Außerdem wurde ein Audio-Playground in Mistral Studio gestartet, der das Testen von Transkriptionen mit Diarisierung und Zeitstempeln ermöglicht. Voxtral Mini Transcribe V2 ist über die API zum Preis von 0,003 US-Dollar pro Minute verfügbar, Voxtral Real-time für 0,006 US-Dollar pro Minute und als offene Gewichte. Beide Modelle unterstützen die Bereitstellung gemäß GDPR und HIPAA (Datenschutz-Grundverordnung und Health Insurance Portability and Accountability Act) über lokale oder private Cloud-Installationen.
Quelle: Mistral AI — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten