настраивать задержку до суб-200 мс. Модель имеет 4B параметров, поддерживает 13 языков (включая английский, китайский, хинди, испанский, арабский, французский, португальский, русский, немецкий, японский, корейский, итальянский и нидерландский) и распространяется с открытыми весами под лицензией Apache 2.0 на Hugging Face Hub. Voxtral Mini Transcribe V2 обеспечивает уровень ошибок около 4% на FLEURS и стоит $0.003/мин — это, по заявлению компании, лучшее соотношение цены и производительности среди API транскрипции. Модель превосходит GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal и Deepgram Nova по точности, обрабатывает аудио примерно в 3 раза быстрее ElevenLabs Scribe v2 при той же точности и в пять раз дешевле. Voxtral Mini Transcribe V2 поддерживает диэризацию (создание меток дикторов с точным временем начала и окончания), контекстное управление (до 100 слов для корректировки написания), посекундные временные метки, устойчивость к шуму, обработку аудио до 3 часов и те же 13 языков. Также запущен аудио-плейграунд в Mistral Studio, позволяющий тестировать транскрипцию с диэризацией и временными метками. Voxtral Mini Transcribe V2 доступен через API по цене $0.003/мин, Voxtral Realtime — $0.006/мин и в виде открытых весов. Обе модели поддерживают развертывание в соответствии с GDPR и HIPAA через локальные или частные облачные установки.