ModelosCódigo Abierto 🇺🇸 27.07.2026 16:05

Mistral AI Lanza Voxtral Transcribe 2 — Modelos de Reconocimiento de Voz de Latencia Ultra Baja

MistralMistral Mistral AIMistral AI
Mistral AI ha presentado la familia de modelos Voxtral Transcribe 2, que incluye Voxtral Mini Transcribe V2 para transcripción por lotes y Voxtral Realtime para aplicaciones en vivo. Voxtral Realtime se distribuye con pesos abiertos bajo la licencia Apache 2.0. Los modelos admiten 13 idiomas, diarización y control contextual, mientras que Voxtral Mini Transcribe V2 ofrece bajo costo ($0.003/min) y alta precisión.
Mistral AI ha anunciado el lanzamiento de Voxtral Transcribe 2, dos nuevos modelos de reconocimiento de voz diseñados para transcripción de alta calidad, diarización y latencia mínima. La familia incluye Voxtral Mini Transcribe V2 para procesamiento por lotes y Voxtral Realtime para aplicaciones en vivo. Voxtral Realtime utiliza una nueva arquitectura de streaming que procesa el audio a medida que llega y permite ajustar la latencia hasta menos de 200 ms. El modelo tiene 4 mil millones de parámetros, admite 13 idiomas (incluyendo inglés, chino, hindi, español, árabe, francés, portugués, ruso, alemán, japonés, coreano, italiano y neerlandés) y se distribuye con pesos abiertos bajo licencia Apache 2.0 en Hugging Face Hub. Voxtral Mini Transcribe V2 ofrece una tasa de error de aproximadamente el 4% en FLEURS y cuesta 0,003 dólares por minuto, lo que, según la compañía, representa la mejor relación calidad-precio entre las API de transcripción. El modelo supera a GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal y Deepgram Nova en precisión, procesa el audio aproximadamente tres veces más rápido que ElevenLabs Scribe v2 con la misma precisión y es cinco veces más barato. Voxtral Mini Transcribe V2 admite diarización (creación de etiquetas de hablantes con tiempos de inicio y finalización precisos), control contextual (hasta 100 palabras para corregir la ortografía), marcas de tiempo por segundo, resistencia al ruido, procesamiento de audio de hasta tres horas y los mismos 13 idiomas. También se ha lanzado un audio playground en Mistral Studio que permite probar la transcripción con diarización y marcas de tiempo. Voxtral Mini Transcribe V2 está disponible a través de API a 0,003 dólares por minuto, Voxtral Realtime a 0,006 dólares por minuto y también con pesos abiertos. Ambos modelos admiten implementación compatible con el Reglamento General de Protección de Datos (RGPD) y la Ley de Portabilidad y Responsabilidad del Seguro Médico (HIPAA) mediante instalaciones locales o en la nube privada.
Fuente: Mistral AI — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas