NVIDIA stellt NemotronLabs VoiceChat 11B vor: offenes Full-Duplex-Sprachmodell mit 450 ms Turn-Taking und Live-Tool-Aufrufen
NVIDIA
NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein offenes Full-Duplex-Sprachmodell, das in einem einzigen Netzwerk Streaming-Sprachverständnis und -generierung durchführt und eine Turn-Taking-Latenz von 448 ms erreicht. Es ist das erste offene Full-Duplex-Modell, das während des Gesprächs Tool-Aufrufe unterstützt, mittels eines Seitenkanals und operatorspezifischer Warteschleifen-Nachrichten. Das Modell ist nur für Forschungs-Pilotprojekte verfügbar, benötigt eine GPU mit 80 GB und hat noch keine gehostete API.
NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein offenes 11B End-to-End-Sprachmodell für Echtzeit-Vollduplex-Konversationen. Im Gegensatz zu kaskadierten Systemen vereint es Sprachverständnis und -erzeugung in einem einzigen Netzwerk, wodurch die Orchestrierung mehrerer Modelle entfällt und die Latenz auf 448 ms im Full-Duplex-Bench 1.0 reduziert wird. Das Modell ermöglicht Unterbrechungen (Barge-in) mit einer Übernahmerate von 1,00 bei 480 ms. Es ist auch das erste offene Vollduplex-Modell, das Tool-Aufrufe unterstützt, indem es <TOOLCALL>-Skripte auf einem separaten Kanal ausgibt und operator-definierte Warteschleifen verwendet, um Stille während der Ausführung von APIs zu vermeiden. Das Modell kombiniert einen Fast-Conformer-Sprachkodierer von Nemotron-Speech-Streaming-En-0.6b, das Nemotron-Nano-v2-LLM-Backbone und einen NVIDIA-TTS-Dekodierer, trainiert mit etwa 550.000 Stunden Audio. Es ist jedoch nur für Forschungszwecke gedacht und weist dokumentierte Schwachstellen auf, wie ein Zwei-Minuten-Audiokontextlimit und eine Verschlechterung nach mehreren Gesprächsrunden. Es erfordert eine einzelne 80-GB-GPU (z.B. A100, H100, RTX 6000 Pro oder B200) und bietet keine gehostete API. Zu den Einschränkungen gehören maximal fünf Tools pro Sitzung und ausschließlich ASCII-Systemprompts. Die Leistungswerte umfassen 58,5 % einfache Tool-Aufrufe im AU Harness BFCL-v3 und 82,5 % Tool-Auswahl im Full-Duplex-Bench v3. Das Modell belegt Platz zwei unter den offenen Vollduplex-Modellen in VoiceBench und Full-Duplex-Bench 1.0.
Quelle: MarkTechPost —
Original
