Hardware & InferenzModelle 🇺🇸 10.08.2026 20:01

NVIDIA Magpie TTS: Open-Weight Modell für mehrsprachige Sprachgenerierung mit voller Bereitstellungskontrolle

NVIDIANVIDIA
NVIDIA veröffentlicht Magpie TTS Multilingual, ein Open-Weight-Modell, das 12 Sprachen unterstützt, darunter Neuzugänge wie modernes Hocharabisch, Koreanisch und brasilianisches Portugiesisch. Das Modell bietet geringe Latenz durch Frame-Stacking und lokale Transformer-Techniken sowie flexible Bereitstellungsoptionen über NVIDIA NIM und Hugging-Face-Checkpoints.
NVIDIA stellt Magpie TTS Multilingual vor, ein Text-to-Speech-Modell mit offenen Gewichten und 364 Millionen Parametern, das 12 Sprachen unterstützt, darunter die neuen Sprachen Modernes Hocharabisch, Koreanisch und brasilianisches Portugiesisch. Das Modell ist für Sprachagenten mit geringer Latenz ausgelegt und erreicht eine Zeit bis zum ersten Audio (TTFA) von 32 ms auf B200-GPUs bei hohem Durchsatz. Zu den architektonischen Verbesserungen gehören Frame-Stacking zur Reduzierung der Decoder-Iterationen und ein lokaler Transformer zur Aufrechterhaltung der Audioqualität. Die Veröffentlichung hebt verbesserte Qualitätskennzahlen hervor, wie reduzierte Zeichenfehlerraten (CER) und höhere Sprecherähnlichkeit (SSIM) für Französisch und Spanisch. Entwickler können das Modell mithilfe von NVIDIA NIM oder Hugging-Face-Checkpoints auf ihrer eigenen Infrastruktur bereitstellen, es mit NVIDIA NeMo anpassen und in das Nemotron Voice Agent Developer Example integrieren, um vollständige Sprachagenten zu erstellen.
Quelle: Hugging Face blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten