研究媒体生成 🇷🇺 06.08.2026 19:05

圣彼得堡大学科学家提升神经网络对话能力

圣彼得堡国立大学的语言学家通过嵌入语调模型,改善了神经网络的对话能力,使人工智能的发音更加自然。这一进展有望增强用于语音助手和拟人机器人的文本转语音系统。研究结果已发表于国际语音与计算机会议论文集。
圣彼得堡国立大学的语言学家通过嵌入语调模型,提升了神经网络的对话能力,使AI的发音更加自然、更贴近人类。这一进展旨在改进用于语音助手和拟人机器人的文本转语音系统。研究成果已发表于《国际语音与计算机会议论文集》。基于AI的系统已能在许多任务中完全或部分取代人类,尤其是常规性任务,但语调的实现一直颇具挑战。语调对于表达情感、态度及交际意义至关重要,例如区分疑问句与陈述句。传统语言模型往往产生单调或不恰当的语调。圣彼得堡国立大学的语言学家采用了Tacotron2模型进行文本转语音合成,并利用该校开发的专门语调分类法对其进行训练。该分类涵盖广泛的语调变体,考虑旋律范围、语速和句子类型等因素。这些改进使神经网络得以克服不自然或单调语调的局限。在一项评估中,42名俄语母语者收听了合成的音频,普遍认为其自然,仅存在少量细微瑕疵。在第二项实验中,参与者能更轻松地识别疑问短语。研究者建议进一步通过情感和风格变体进行微调,以提升质量。
来源: CNews — 原文
我们之前关于此话题的帖子 ↓
最新新闻