ModelAgen 🇺🇸 10.08.2026 03:03

NVIDIA Luncurkan Model Pidato Full-Duplex Terbuka NemotronLabs VoiceChat 11B dengan Turn-Taking 450 ms dan Pemanggilan Alat Langsung

NVIDIANVIDIA
NVIDIA telah merilis NemotronLabs VoiceChat 11B, model pidato-ke-pidato full-duplex terbuka yang melakukan pemahaman dan pembangkitan ucapan streaming dalam satu jaringan, mencapai latensi turn-taking 448 ms. Ini adalah model full-duplex terbuka pertama yang mendukung pemanggilan alat saat berbicara, menggunakan saluran samping dan pesan tahan operator. Model ini tersedia hanya untuk proyek penelitian percontohan, membutuhkan GPU 80 GB, dan belum memiliki API yang di-hosting.
NVIDIA merilis NemotronLabs VoiceChat 11B, model speech-to-speech end-to-end open-source 11B untuk percakapan real-time full-duplex. Berbeda dengan sistem kaskade, model ini menyatukan pemahaman dan generasi ucapan dalam satu jaringan, menghilangkan orkestrasi multi-model dan mengurangi latensi menjadi 448 ms pada Full-Duplex-Bench 1.0. Model ini memungkinkan interupsi (barge-in) dengan tingkat pengambilalihan 1,00 pada 480 ms. Model ini juga menjadi pelopor pemanggilan alat (tool calling) dalam model full-duplex open-source, memancarkan skrip <TOOLCALL> pada kanal terpisah dan menggunakan jalur tunggu yang ditentukan operator untuk menghindari keheningan saat API berjalan. Model ini menggabungkan encoder ucapan Fast Conformer dari Nemotron-Speech-Streaming-En-0.6b, backbone LLM Nemotron Nano v2, dan decoder TTS NVIDIA, dilatih pada sekitar 550 ribu jam audio. Namun, model ini hanya untuk tujuan riset, dengan mode kegagalan yang terdokumentasi seperti batas konteks audio dua menit dan penurunan kualitas setelah beberapa giliran percakapan. Model ini memerlukan satu GPU 80 GB (misalnya, A100, H100, RTX 6000 Pro, atau B200) dan tidak memiliki API yang dihosting. Batasan termasuk maksimal lima alat per sesi dan prompt sistem hanya ASCII. Skor kinerja mencakup 58,5% pemanggilan alat sederhana pada AU Harness BFCL-v3 dan 82,5% seleksi alat pada Full-Duplex-Bench v3. Model ini menempati peringkat #2 di antara model full-duplex open-source pada VoiceBench dan Full-Duplex-Bench 1.0.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru