ModelosAgentes 🇺🇸 10.08.2026 03:03

NVIDIA apresenta modelo de fala full-duplex aberto NemotronLabs VoiceChat 11B com tomada de turno de 450 ms e chamada de ferramentas em tempo real

NVIDIANVIDIA
A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo aberto de fala-para-fala full-duplex que realiza compreensão e geração de fala em streaming em uma única rede, alcançando latência de tomada de turno de 448 ms. É o primeiro modelo full-duplex aberto a suportar chamada de ferramentas durante a conversa, usando um canal secundário e mensagens de espera definidas pelo operador. O modelo está disponível apenas para projetos-piloto de pesquisa, requer uma GPU de 80 GB e ainda não possui API hospedada.
A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo aberto de fala para fala (speech-to-speech) com 11B de parâmetros, projetado para conversação full-duplex em tempo real. Ao contrário dos sistemas em cascata, ele unifica compreensão e geração de fala em uma única rede, eliminando a orquestração de múltiplos modelos e reduzindo a latência para 448 ms no Full-Duplex-Bench 1.0. O modelo permite interrupções (barge-in), com uma taxa de takeover de 1,00 em 480 ms. Ele também é pioneiro em chamada de ferramentas em um modelo full-duplex aberto, emitindo scripts <TOOLCALL> em um canal separado e usando linhas de espera definidas pelo operador para evitar silêncio enquanto as APIs são executadas. O modelo combina um codificador de fala Fast Conformer do Nemotron-Speech-Streaming-En-0.6b, o backbone LLM Nemotron Nano v2 e um decodificador TTS da NVIDIA, treinado em aproximadamente 550 mil horas de áudio. No entanto, é apenas para fins de pesquisa, com modos de falha documentados, como um limite de contexto de áudio de dois minutos e degradação após várias interações. Ele requer uma GPU de 80 GB (por exemplo, A100, H100, RTX 6000 Pro ou B200) e não possui API hospedada. As restrições incluem um máximo de cinco ferramentas por sessão e prompts de sistema apenas em ASCII. Os escores de desempenho incluem 58,5% de chamada de ferramentas simples no AU Harness BFCL-v3 e 82,5% de seleção de ferramentas no Full-Duplex-Bench v3. O modelo ocupa a 2ª posição entre os modelos full-duplex abertos no VoiceBench e no Full-Duplex-Bench 1.0.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas