字节跳动豆包双工模型Seeduplex深度解析
ByteDance
字节跳动豆包发布了新模型Seeduplex,支持单工和双工语音模式。该模型具备语音输入、并行感知、打断以及识别多种语言(包括中英混合)的能力。Seeduplex能够模仿多种声音和风格,包括一种结合命令与温和语气的混合风格。
字节跳动旗下豆包发布了名为Seeduplex的新型双工语音模型。评测显示,该模型具备并行感知与打断能力,并能识别他人语音。它支持语音输入、单工与双工模式,可同时识别包括敲桌声在内的多种声音。Seeduplex能模仿音色与风格(例如以“有力”结尾的命令语气),还能模拟温柔嗓音并加入一丝笑意。它可根据要求切换男女声、按指令调整语气。此外,该模型支持中英混说、识别多数中文口音(如部分“北方”口音),并能朗读多种字体的手写文本。
来源: ByteDance Doubao (GNews) —
原文
