NVIDIA Magpie TTS : génération vocale multilingue à poids ouverts avec contrôle total du déploiement
NVIDIA
NVIDIA publie Magpie TTS Multilingue, un modèle à poids ouverts prenant en charge 12 langues, dont de nouveaux ajouts comme l'arabe standard moderne, le coréen et le portugais brésilien. Le modèle offre une faible latence grâce à l'empilement de trames et aux techniques de transformateur local, avec une flexibilité de déploiement via NVIDIA NIM et les points de contrôle de Hugging Face.
NVIDIA présente Magpie TTS Multilingual, un modèle de synthèse vocale à poids ouverts de 364 millions de paramètres prenant en charge 12 langues, avec de nouveaux ajouts : l'arabe standard moderne, le coréen et le portugais brésilien. Le modèle est conçu pour les agents vocaux à faible latence, atteignant un délai avant le premier audio (en anglais, time-to-first-audio, TTFA) de 32 millisecondes sur les GPU B200 et offrant un haut débit. Les améliorations architecturales incluent l'empilement de trames pour réduire les itérations du décodeur et un transformateur local pour maintenir la qualité audio. La version met en évidence des mesures de qualité améliorées, telles que des taux d'erreur de caractères réduits et une similarité de locuteur plus élevée pour le français et l'espagnol. Les développeurs peuvent déployer le modèle sur leur propre infrastructure à l'aide de NVIDIA NIM ou des points de contrôle Hugging Face, le personnaliser avec NVIDIA NeMo et l'intégrer à l'exemple de développement d'agent vocal Nemotron pour créer des agents vocaux complets.
Source: Hugging Face blog —
original
