Mistral AI, Voxtral Transcribe 2 출시 — 초저지연 음성 인식 모델
Mistral
Mistral AI
Mistral AI가 Voxtral Transcribe 2를 출시했습니다. 이는 일괄 전사를 위한 Voxtral Mini Transcribe V2와 실시간 애플리케이션을 위한 Voxtral Realtime(지연 시간 200ms 미만)을 포함하는 음성-텍스트 모델군입니다. Voxtral Realtime은 Apache 2.0 라이선스로 오픈웨이트입니다. 두 모델 모두 13개 언어를 지원하며 화자 분리 기능을 갖춘 최첨단 전사 품질을 제공합니다.
Mistral AI가 차세대 음성-텍스트 모델 제품군인 Voxtral Transcribe 2를 출시했습니다. 이 제품군에는 배치 변환을 위한 Voxtral Mini Transcribe V2와 지연 시간을 200밀리초 미만으로 설정할 수 있는 실시간 변환용 Voxtral Realtime이 포함됩니다. Voxtral Realtime은 Apache 2.0 라이선스 하에 오픈 웨이트로 제공됩니다. 두 모델 모두 영어, 중국어, 힌디어, 스페인어, 아랍어, 프랑스어, 포르투갈어, 러시아어, 독일어, 일본어, 한국어, 이탈리아어, 네덜란드어의 13개 언어를 지원합니다. Voxtral Mini Transcribe V2는 분당 0.003달러의 비용으로 FLEURS 벤치마크에서 약 4%의 단어 오류율을 달성하여 GPT-4o mini Transcribe 및 Gemini 2.5 Flash와 같은 경쟁 제품을 능가합니다. 또한 화자 분리, 문맥 편향, 단어 단위 타임스탬프, 잡음 내성 기능을 갖추고 있으며 최대 3시간 길이의 오디오를 지원합니다. 4B 매개변수를 사용하는 Voxtral Realtime은 엣지 디바이스에서 효율적으로 실행되며 480밀리초 지연에서도 거의 오프라인 수준의 정확도를 제공합니다. Mistral은 또한 화자 분리 및 타임스탬프가 포함된 변환을 테스트할 수 있는 오디오 플레이그라운드를 Mistral Studio에 출시했습니다.
출처: Mistral AI —
원문
