NVIDIA presenta NemotronLabs VoiceChat 11B, un modelo de voz full-duplex abierto con turnos de 450 ms y llamadas a herramientas en vivo
NVIDIA
NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo abierto de voz a voz full-duplex que realiza comprensión y generación de voz en streaming en una sola red, logrando una latencia de turno de 448 ms. Es el primer modelo full-duplex abierto que admite llamadas a herramientas mientras conversa, utilizando un canal lateral y mensajes de espera definidos por el operador. El modelo está disponible solo para proyectos piloto de investigación, requiere una GPU de 80 GB y aún no tiene una API alojada.
NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo abierto de voz a voz de 11B para conversación full-duplex en tiempo real. A diferencia de los sistemas en cascada, unifica la comprensión y generación del habla en una única red, eliminando la orquestación de múltiples modelos y reduciendo la latencia a 448 ms en Full-Duplex-Bench 1.0. El modelo permite interrumpir al hablante, con una tasa de interrupción de 1.00 a 480 ms. También es pionero en la llamada a herramientas en un modelo full-duplex abierto, emitiendo scripts <TOOLCALL> en un canal separado y utilizando líneas de espera definidas por el operador para evitar silencios mientras se ejecutan las API. El modelo combina un codificador de habla Fast Conformer de Nemotron-Speech-Streaming-En-0.6b, el backbone LLM Nemotron Nano v2 y un decodificador TTS de NVIDIA, entrenado con unas 550.000 horas de audio. Sin embargo, es solo para fines de investigación, con modos de fallo documentados, como un límite de contexto de audio de dos minutos y degradación después de varias interacciones. Requiere una GPU de 80 GB (por ejemplo, A100, H100, RTX 6000 Pro o B200) y no tiene API alojada. Las limitaciones incluyen un máximo de cinco herramientas por sesión y avisos del sistema solo con caracteres ASCII. Las puntuaciones de rendimiento incluyen un 58,5% en llamadas a herramientas simples en AU Harness BFCL-v3 y un 82,5% en selección de herramientas en Full-Duplex-Bench v3. El modelo ocupa el puesto número 2 entre los modelos full-duplex abiertos en VoiceBench y Full-Duplex-Bench 1.0.
Fuente: MarkTechPost —
original
