NVIDIA esittelee NemotronLabs VoiceChat 11B -avoimen full-duplex-puhemallin, jonka vuorottelun viive on 450 ms ja joka tukee työkalujen reaaliaikaista kutsuntaa
NVIDIA
NVIDIA on julkaissut NemotronLabs VoiceChat 11B:n, avoimen full-duplex-puheesta puheeseen -mallin, joka suorittaa suoratoistavan puheen ymmärtämisen ja tuottamisen yhdessä verkossa saavuttaen 448 ms:n vuorottelun viiveen. Se on ensimmäinen avoin full-duplex-malli, joka tukee työkalujen kutsuntaa keskustelun aikana käyttämällä sivukanavaa ja operaattorin määrittämiä pitoviestejä. Malli on saatavilla vain tutkimuksen pilottiprojekteihin, vaatii 80 Gt:n GPU:n, eikä siihen ole vielä isännöityä API-rajapintaa.
NVIDIA julkaisi NemotronLabs VoiceChat 11B:n, avoimen 11B-painotteisen puheesta puheeseen -mallin, joka on tarkoitettu reaaliaikaiseen, täysin duplex-keskusteluun. Toisin kuin kaskadijärjestelmissä, se yhdistää puheen ymmärtämisen ja tuottamisen yhteen verkkoon, mikä poistaa useiden mallien koordinoinnin ja vähentää viivettä 448 millisekuntiin Full-Duplex-Bench 1.0 -testissä. Malli mahdollistaa keskeytykset, ja sen haltuunottoaste on 1,00 480 millisekunnissa. Se on myös ensimmäinen avoin täysin duplex-malli, joka tukee työkalujen kutsumista: se tuottaa <TOOLCALL>-skriptejä erillisellä kanavalla ja käyttää operaattorin määrittelemiä pitolinjoja välttääkseen hiljaisuuden API-kutsujen aikana. Malli yhdistää Fast Conformer -puheenkooderin Nemotron-Speech-Streaming-En-0.6b:stä, Nemotron Nano v2 LLM -selkärangan ja NVIDIA TTS -dekooderin, ja se on koulutettu noin 550 000 tunnin audioaineistolla. Se on kuitenkin tarkoitettu vain tutkimuskäyttöön, ja sen tunnetut rajoitteet ovat muun muassa kahden minuutin audiokontekstin raja ja laadun heikkeneminen useiden keskustelukierrosten jälkeen. Se vaatii yhden 80 gigatavun GPU:n (esimerkiksi A100, H100, RTX 6000 Pro tai B200) eikä siihen ole tarjolla pilvipalvelua. Rajoitteisiin kuuluu enintään viisi työkalua istuntoa kohden ja ASCII-merkistöön rajoitetut järjestelmäkehotteet. Suorituskykypisteitä ovat 58,5 prosentin yksinkertainen työkalujen kutsuminen AU Harness BFCL-v3 -testissä ja 82,5 prosentin työkalun valinta Full-Duplex-Bench v3 -testissä. Malli sijoittuu toiseksi avointen täysin duplex-mallien joukossa VoiceBench- ja Full-Duplex-Bench 1.0 -vertailuissa.
Lähde: MarkTechPost —
Alkuperäinen
