перебивание (barge-in) с показателем перехвата 1.00 при 480 мс. Она также впервые среди открытых полно дуплексных моделей реализует вызов инструментов, отправляя скрипты <TOOLCALL> по отдельному каналу и используя задаваемые оператором фразы ожидания, чтобы избежать тишины во время выполнения API. Модель объединяет речевой энкодер Fast Conformer из Nemotron-Speech-Streaming-En-0.6b, языковую основу Nemotron Nano v2 и звуковой декодер NVIDIA TTS, обучась на примерно 550 тысячах часов аудио. Однако она предназначена только для исследовательских целей, с документированными ограничениями, такими как двухминутный контекст аудио и ухудшение качества после нескольких реплик. Требуется один графический процессор с памятью 80 ГБ (например, A100, H100, RTX 6000 Pro или B200), а облачный API не предоставляется. Ограничения включают максимум пять инструментов за сеанс и системные подсказки только в кодировке ASCII. Показатели производительности включают 58,5% для простого вызова инструментов на AU Harness BFCL-v3 и 82,5% для выбора инструментов на Full-Duplex-Bench v3. Модель занимает второе место среди открытых полно дуплексных моделей по результатам VoiceBench и Full-Duplex-Bench 1.0.