NVIDIA Magpie TTS: Open-gewichten model voor meertalige spraakgeneratie met volledige implementatiecontrole
NVIDIA
NVIDIA brengt Magpie TTS Multilingual uit, een model met open gewichten dat 12 talen ondersteunt, waaronder nieuwe toevoegingen zoals Modern Standaard Arabisch, Koreaans en Braziliaans Portugees. Het model biedt lage latentie via frame-stacking en lokale transformatortechnieken, met implementatieflexibiliteit via NVIDIA NIM en Hugging Face checkpoints.
NVIDIA introduceert Magpie TTS Multilingual, een open-weights tekst-naar-spraakmodel met 364 miljoen parameters dat 12 talen ondersteunt, met als nieuwe toevoegingen Modern Standaard Arabisch, Koreaans en Braziliaans Portugees. Het model is ontworpen voor voice-agents met lage latentie en behaalt een tijd-tot-eerste-audio (TTFA) van 32 milliseconden op B200-GPU's, met een hoge doorvoer. Architectonische verbeteringen omvatten frame-stacking om decoderiteraties te verminderen en een lokale transformer om de audiokwaliteit te behouden. De release benadrukt verbeterde kwaliteitsstatistieken, zoals lagere karakterfoutpercentages (CER) en hogere sprekerssimilariteit (SSIM) voor Frans en Spaans. Ontwikkelaars kunnen het model implementeren op hun eigen infrastructuur met behulp van NVIDIA NIM of Hugging Face-checkpoints, het aanpassen met NVIDIA NeMo, en integreren met het Nemotron Voice Agent Developer-voorbeeld voor het bouwen van complete voice-agents.
Bron: Hugging Face blog —
origineel
