模型智能体 🇺🇸 10.08.2026 03:03

英伟达发布NemotronLabs VoiceChat 11B开源全双工语音模型,支持450毫秒轮换与实时工具调用

NVIDIANVIDIA
英伟达已发布NemotronLabs VoiceChat 11B,这是一款开源的全双工语音到语音模型,能在单一网络中执行流式语音理解与生成,实现448毫秒的轮换延迟。这是首个在对话中支持工具调用的开源全双工模型,通过旁路通道和运营商定义的保持消息来实现。该模型仅用于研究试点项目,需要80 GB的GPU,目前尚无托管API。
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一个开放的11B端到端语音到语音模型,用于实时全双工对话。与级联系统不同,它将语音理解和生成统一在一个网络中,消除了多模型编排,并将延迟降低到Full-Duplex-Bench 1.0上的448毫秒。该模型支持语音打断,在480毫秒时接管率为1.00。它还在开放的全双工模型中开创了工具调用功能,在单独的信道上发出<TOOLCALL>脚本,并使用运营商定义的保持线路来避免API运行时的静默。该模型结合了Nemotron-Speech-Streaming-En-0.6b中的Fast Conformer语音编码器、Nemotron Nano v2大语言模型主干和NVIDIA TTS解码器,并在约55万小时的音频上进行了训练。然而,它仅用于研究目的,存在记录在案的失败模式,例如两分钟的音频上下文限制和多次对话后性能下降。它需要一块80 GB的GPU(例如A100、H100、RTX 6000 Pro或B200),且没有托管的API。限制包括每次会话最多五个工具,以及仅限ASCII的系统提示。性能得分包括在AU Harness BFCL-v3上简单工具调用准确率为58.5%,在Full-Duplex-Bench v3上工具选择准确率为82.5%。该模型在VoiceBench和Full-Duplex-Bench 1.0上排名第二,位于开放全双工模型之中。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻