способность. Архитектурные улучшения включают группировку кадров для сокращения итераций декодера и локальный трансформер для поддержания качества аудио. Релиз подчеркивает улучшенные метрики качества, такие как снижение уровня ошибок в символах (CER) и более высокая схожесть спикера (SSIM) для французского и испанского языков. Разработчики могут развернуть модель на своей собственной инфраструктуре с помощью NVIDIA NIM или контрольных точек Hugging Face, настроить её с помощью NVIDIA NeMo и интегрировать с примером разработчика голосового агента Nemotron для создания полноценных голосовых агентов.