NVIDIA представила открытую полно-дуплексную речевую модель NemotronLabs VoiceChat 11B с задержкой смены реплики 450 мс и живым вызовом инструментов
Компания NVIDIA выпустила модель NemotronLabs VoiceChat 11B — открытую полно-дуплексную модель «речь-в-речь», которая выполняет потоковое распознавание и генерацию речи в единой сети, достигая задержки смены реплики 448 мс. Это первая открытая полно-дуплексная модель, поддерживающая вызов инструментов во время разговора, используя побочный канал и задаваемые оператором сообщения ожидания. Модель доступна только для исследовательских пилотных проектов, требует графический процессор объемом 80 ГБ и пока не имеет размещенного API.
NVIDIA выпустила NemotronLabs VoiceChat 11B — открытую сквозную модель «речь-в-речь» с 11 миллиардами параметров для полно дуплексного общения в реальном времени. В отличие от каскадных систем, она объединяет распознавание и генерацию речи в одной сети, устраняя необходимость в оркестрации нескольких моделей и снижая задержку до 448 мс на эталоне Full-Duplex-Bench 1.0. Модель поддерживает
Показать ещё ↓
Источник: MarkTechPost —
оригинал
