ModèlesOpen Source 🇺🇸 27.07.2026 16:05

Mistral AI publie Voxtral Transcribe 2 — des modèles de reconnaissance vocale à latence ultra-faible

MistralMistral Mistral AIMistral AI
Mistral AI a dévoilé la famille de modèles Voxtral Transcribe 2, comprenant Voxtral Mini Transcribe V2 pour la transcription par lots et Voxtral Realtime pour les applications en direct. Voxtral Realtime est distribué avec des poids ouverts sous licence Apache 2.0. Les modèles prennent en charge 13 langues, la diarisation et le contrôle contextuel, tandis que Voxtral Mini Transcribe V2 offre un coût faible (0,003 $ par minute) et une grande précision.
Mistral AI a annoncé la sortie de Voxtral Transcribe 2, une famille de deux nouveaux modèles de reconnaissance vocale conçus pour une transcription de haute qualité, une diarisation et une latence minimale. La famille comprend Voxtral Mini Transcribe V2 pour le traitement par lots et Voxtral Realtime pour les applications en direct. Voxtral Realtime utilise une nouvelle architecture de streaming, traitant l'audio au fur et à mesure de sa réception, et permet de configurer la latence jusqu'à moins de 200 ms. Le modèle compte 4 milliards de paramètres, prend en charge 13 langues (dont l'anglais, le chinois, l'hindi, l'espagnol, l'arabe, le français, le portugais, le russe, l'allemand, le japonais, le coréen, l'italien et le néerlandais) et est distribué avec des poids ouverts sous licence Apache 2.0 sur Hugging Face Hub. Voxtral Mini Transcribe V2 atteint un taux d'erreur d'environ 4% sur FLEURS et coûte 0,003 $/min — ce qui, selon l'entreprise, constitue le meilleur rapport qualité-prix parmi les API de transcription. Le modèle surpasse GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal et Deepgram Nova en précision, traite l'audio environ trois fois plus vite qu'ElevenLabs Scribe v2 à précision égale et coûte cinq fois moins cher. Voxtral Mini Transcribe V2 prend en charge la diarisation (création d'étiquettes de locuteurs avec des horodatages précis de début et de fin), le contrôle contextuel (jusqu'à 100 mots pour la correction orthographique), des horodatages à la seconde près, la robustesse au bruit, le traitement audio jusqu'à 3 heures et les mêmes 13 langues. Un audio playground a également été lancé dans Mistral Studio, permettant de tester la transcription avec diarisation et horodatages. Voxtral Mini Transcribe V2 est disponible via API au prix de 0,003 $/min, Voxtral Realtime à 0,006 $/min et sous forme de poids ouverts. Les deux modèles prennent en charge le déploiement conforme au RGPD et à la HIPAA via des installations locales ou cloud privé.
Source: Mistral AI — original
Nos articles précédents sur ce sujet ↓
Infos fraîches