NVIDIA onthult NemotronLabs VoiceChat 11B open full-duplex spraakmodel met 450 ms beurtwisseling en live tool-aanroep
NVIDIA
NVIDIA heeft NemotronLabs VoiceChat 11B uitgebracht, een open full-duplex spraak-naar-spraakmodel dat streaming spraakverstaan en -generatie in één netwerk uitvoert, met een latentie van 448 ms voor beurtwisseling. Het is het eerste open full-duplex model dat tool-aanroep ondersteunt tijdens het converseren, met behulp van een nevenkanaal en door de operator gedefinieerde wachtberichten. Het model is alleen beschikbaar voor onderzoekspilootprojecten, vereist een GPU van 80 GB en heeft nog geen gehoste API.
NVIDIA heeft NemotronLabs VoiceChat 11B uitgebracht, een open 11B end-to-end spraak-naar-spraakmodel voor realtime full-duplex conversatie. In tegenstelling tot gecascadeerde systemen verenigt het spraakbegrip en -generatie in één netwerk, waardoor multi-modelorkestratie wordt geëlimineerd en de latentie wordt teruggebracht tot 448 ms op Full-Duplex-Bench 1.0. Het model maakt barge-in mogelijk, met een overnamepercentage van 1,00 bij 480 ms. Het is ook een pionier op het gebied van tool calling in een open full-duplexmodel, waarbij <TOOLCALL>-scripts op een apart kanaal worden uitgezonden en gebruik wordt gemaakt van door de operator gedefinieerde wachtlijnen om stilte te voorkomen terwijl API's worden uitgevoerd. Het model combineert een Fast Conformer-spraakencoder van Nemotron-Speech-Streaming-En-0.6b, de Nemotron Nano v2 LLM-backbone en een NVIDIA TTS-decoder, getraind op ongeveer 550k uur aan audio. Het is echter uitsluitend bedoeld voor onderzoeksdoeleinden, met gedocumenteerde faalmodi zoals een audiocontextlimiet van twee minuten en degradatie na meerdere beurten. Het vereist één GPU van 80 GB (bijv. A100, H100, RTX 6000 Pro of B200) en heeft geen gehoste API. Beperkingen omvatten een maximum van vijf tools per sessie en ASCII-only systeemprompts. Prestatiescores omvatten 58,5% eenvoudige tool calling op AU Harness BFCL-v3 en 82,5% toolselectie op Full-Duplex-Bench v3. Het model staat op #2 bij open full-duplexmodellen op VoiceBench en Full-Duplex-Bench 1.0.
Bron: MarkTechPost —
origineel
