NVIDIA Magpie TTS: Generasi Suara Multibahasa dengan Bobot Terbuka dan Kontrol Deployment Penuh
NVIDIA
NVIDIA merilis Magpie TTS Multilingual, model dengan bobot terbuka yang mendukung 12 bahasa, termasuk tambahan baru seperti Bahasa Arab Standar Modern, Bahasa Korea, dan Bahasa Portugis Brasil. Model ini menawarkan latensi rendah melalui teknik frame stacking dan transformer lokal, dengan fleksibilitas deployment melalui NVIDIA NIM dan checkpoint Hugging Face.
NVIDIA memperkenalkan Magpie TTS Multilingual, model text-to-speech open-weights dengan 364 juta parameter yang mendukung 12 bahasa, dengan penambahan baru yaitu Bahasa Arab Standar Modern, Bahasa Korea, dan Bahasa Portugis Brasil. Model ini dirancang untuk agen suara berlatensi rendah, mencapai waktu ke audio pertama (TTFA) sebesar 32ms pada GPU B200 dan menawarkan throughput tinggi. Peningkatan arsitektur mencakup penumpukan bingkai untuk mengurangi iterasi decoder dan transformer lokal untuk menjaga kualitas audio. Rilis ini menyoroti metrik kualitas yang lebih baik, seperti tingkat kesalahan karakter (CER) yang lebih rendah dan kemiripan pembicara (SSIM) yang lebih tinggi untuk bahasa Prancis dan Spanyol. Pengembang dapat menerapkan model ini di infrastruktur mereka sendiri menggunakan NVIDIA NIM atau checkpoint di Hugging Face, menyesuaikan dengan NVIDIA NeMo, dan mengintegrasikannya dengan Contoh Pengembang Agen Suara Nemotron untuk membangun agen suara yang lengkap.
Sumber: Hugging Face blog —
asli
