PVAD:如何教会AI在嘈杂环境中识别目标说话人
Singularis团队开发了PVAD技术,用于在通用音频流中检测特定人物何时说话,旨在隔离其声音同时抑制背景噪声和其他人声。他们进行了超过100次实验,在语音活动检测方面达到了目标指标,但无法复现最先进的降噪效果,这凸显了该方法的局限性。
Singularis团队致力于PVAD(个人语音活动检测)技术,该技术用于确定音频流中特定说话者何时发声。基于目标说话者的简短语音样本,系统需要识别语音片段、抑制背景噪声及其他人的声音,并尝试在无说话人分离的情况下复制最先进的降噪方法。该项目以Demucs为基础,并辅以ResNet架构和x-vector技术生成的语音嵌入,同时使用了Kaldi、PyTorch和TensorFlow。训练和评估使用了包括LibriSpeech和VoxCeleb2在内的大型公共数据集,总数据量超过1太字节,外加小型客户数据集。进行了超过100次实验,团队在近麦克风和远麦克风条件下均达到了PVAD的目标指标,并提高了客户测试数据的模型质量。然而,降噪器轮廓未能在时间限制内达到SOTA水平,团队认为这是关于该方法适用性的一个重要发现。
来源: Habr — хаб ИИ —
原文
