Mistral AI выпускает Voxtral Transcribe 2: две новые модели распознавания речи с ультранизкой задержкой
Mistral
Компания Mistral AI анонсировала модели Voxtral Mini Transcribe V2 для пакетной транскрипции и Voxtral Realtime для транскрипции в реальном времени. Voxtral Realtime доступна с открытыми весами под лицензией Apache 2.0, а Voxtral Mini Transcribe V2 предлагает лучшую производительность по цене $0,003 в минуту.
Mistral AI выпустила семейство моделей Voxtral Transcribe 2, включающее Voxtral Mini Transcribe V2 для пакетной обработки и Voxtral Realtime для транскрипции в реальном времени с задержкой менее 200 мс. Voxtral Realtime имеет открытые веса под лицензией Apache 2.0 и основания для развёртывания на граничных устройствах. Voxtral Mini Transcribe V2 показывает частоту ошибок около 4% на бенчмарке FLEURS при цене $0,003 за минуту, что обеспечивает лучшее соотношение цены и производительности среди API транскрипции. Модель превосходит GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal и Deepgram Nova по точности, обрабатывает аудио примерно в 3 раза быстрее ElevenLabs Scribe v2 при сопоставимом качестве и в пять раз меньшей стоимости. Обе модели поддерживают 13 языков, включая русский. Voxtral Mini Transcribe V2 предлагает диаризацию дикторов, контекстное смещение, покадровые временные метки, устойчивость к шуму и обработку аудио длительностью до 3 часов. Модели соответствуют требованиям GDPR и HIPAA при развёртывании на локальных или приватных облачных серверах. Mistral AI также запустила аудиоплейграунд в Mistral Studio для тестирования моделей.
- Сокращения
- API = Application Programming Interface — интерфейс программирования приложений
- GDPR = General Data Protection Regulation — Общий регламент по защите данных
- HIPAA = Health Insurance Portability and Accountability Act — Закон о переносимости и подотчётности медицинского страхования
- LLM = Large Language Model — большая языковая модель
- TTS = Text-to-Speech — синтез речи из текста
Источник: Mistral AI —
оригинал
