模型商业与市场 🇺🇸 31.07.2026 09:02

PolyAI 发布 Dialog-RSN-1:音频原生对话模型,整合话轮管理、语音识别、函数调用和回复生成

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
PolyAI 发布了 Dialog-RSN-1,这是一款音频原生对话模型,直接处理音频,将话轮管理、语音识别、函数调用和回复生成整合于一体。该模型已在生产环境中应用,回复延迟低于 300 毫秒,并在保持对话和延迟方面分别提升了 11% 和 37%。该模型仅通过 PolyAI 平台提供,未开放权重或公开应用程序接口。
PolyAI发布了Dialog-RSN-1,这是一款对话模型,它直接处理来电者的音频,而非读取转录文本。它将话轮管理、语音识别、函数调用和响应生成整合到同一个原生音频模型中,并且已经在处理实时生产电话。模型输入为音频,但TTS保持独立,以便控制语音。该模型按需运行,而非持续流式处理,因此不会持续占用GPU。第一个输出令牌是话轮决策:EMPTY、ONGOING或COMPLETE。PolyAI报告响应时间低于300毫秒,在餐饮集团中相对改进的约束保持率提高了11%,在保险公司中延迟降低了37%。该模型仅通过PolyAI平台提供,没有开放权重和公开API,且仅支持英语。架构包括基于开放权重多模态模型的后训练,使用监督微调和强化学习微调于自有数据。PolyAI评估了Gemma、GPT-OSS、Qwen和Mistral。延迟优化包括预填充注意力缓存、提示模板附加、将每个来电者路由到同一GPU、平均接受3.9个令牌的推测解码,以及在RFT期间学习到的自动推理。转录在最后进行,并与语音生成并行。PolyAI在内部基准Dialog-Eval上评估了模型,并计划开源该基准。对于非英语语言,推荐使用Raven 3.5。关于Dialog-Eval的技术报告和论文已计划发布。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻