미디어 생성 🇺🇸 27.07.2026 15:06

Mistral AI, 다국어 음성 합성 모델 Voxtral TTS 출시

MistralMistral ElevenLabsElevenLabs
Mistral AI가 40억 파라미터의 텍스트 음성 변환 모델 Voxtral TTS를 출시했습니다. 이 모델은 9개 언어로 현실적이고 감정 표현이 풍부한 음성을 낮은 지연 시간으로 생성하며, 간편한 음성 적응이 가능합니다. API 및 Mistral Studio를 통해 이용할 수 있으며, 1,000자당 0.016달러부터 시작합니다.
Mistral AI가 최초의 텍스트 음성 변환 모델인 Voxtral TTS를 발표했습니다. 이 모델은 4B 파라미터로 최첨단 다국어 음성 생성을 제공합니다. 영어, 프랑스어, 독일어, 스페인어, 네덜란드어, 포르투갈어, 이탈리아어, 힌디어, 아랍어 등 9개 언어를 지원합니다. 지연 시간이 짧고(모델 지연 시간 70ms), 제로 샷 교차 언어 음성 적응이 가능하며, 문맥 이해를 통한 감정 표현력을 갖췄습니다. 음성 적응에는 단 3초의 참조 오디오만 필요합니다. 인간 평가 결과 ElevenLabs Flash v2.5보다 자연스러움이 우수했으며, ElevenLabs v3의 품질과 일치했습니다. 아키텍처는 3.4B 트랜스포머 디코더 백본, 390M 플로우 매칭 음향 트랜스포머, 300M 신경 오디오 코덱으로 구성됩니다. API를 통해 1,000자당 0.016달러에 사용 가능하며, Mistral Studio에서도 이용할 수 있습니다. 모델 가중치의 일부는 Hugging Face에서 CC BY NC 4.0 라이선스로 공개되었습니다.
출처: Mistral AI — 원문
관련 게시물 ↓
새로운 뉴스