Mistral AI Lança Voxtral Transcribe 2 — Modelos de Reconhecimento de Fala com Latência Ultrabaixa
Mistral
Mistral AI
A Mistral AI lançou o Voxtral Transcribe 2, uma família de modelos de fala para texto incluindo o Voxtral Mini Transcribe V2 para transcrição em lote e o Voxtral Realtime para aplicações ao vivo com latência inferior a 200ms. O Voxtral Realtime tem pesos abertos sob licença Apache 2.0. Ambos os modelos suportam 13 idiomas e oferecem qualidade de transcrição de ponta com diarização de falantes.
A Mistral AI lançou o Voxtral Transcribe 2, uma nova família de modelos de reconhecimento de fala de última geração. Ela inclui o Voxtral Mini Transcribe V2 para transcrição em lote e o Voxtral Realtime para transcrição ao vivo com latência configurável de até menos de 200 ms. O Voxtral Realtime possui pesos abertos sob licença Apache 2.0. Ambos os modelos suportam 13 idiomas: inglês, chinês, hindi, espanhol, árabe, francês, português, russo, alemão, japonês, coreano, italiano e holandês. O Voxtral Mini Transcribe V2 atinge aproximadamente 4% de taxa de erro de palavras no benchmark FLEURS a US$ 0,003 por minuto, superando concorrentes como GPT-4o mini Transcribe e Gemini 2.5 Flash. Ele também oferece diarização de falantes, ajuste de contexto, timestamps no nível da palavra, robustez a ruídos e suporte a áudio de até 3 horas. O Voxtral Realtime, com 4 bilhões de parâmetros, funciona eficientemente em dispositivos de borda e fornece precisão quase offline mesmo com um atraso de 480 ms. A Mistral também lançou um playground de áudio no Mistral Studio para testar a transcrição com diarização e timestamps.
Fonte: Mistral AI —
original
