PVAD: 잡음이 많은 방에서 AI가 올바른 사람의 목소리를 듣게 하는 방법
Singularis 팀은 일반 오디오 스트림에서 특정 사람이 말하는 시점을 감지하는 기술인 PVAD를 개발하여, 배경 소음과 다른 목소리를 억제하면서 그 사람의 목소리를 분리하는 것을 목표로 했습니다. 그들은 100회 이상의 실험을 수행하여 음성 활동 감지에 대한 목표 지표를 달성했지만, 최신 기술(SOTA) 수준의 잡음 제거 결과를 재현하지 못해 접근 방식의 한계를 드러냈습니다.
Singularis 팀은 PVAD(개인 음성 활동 감지)라는 기술을 연구했는데, 이는 오디오 스트림에서 특정인이 말하는 시점을 판별하는 기술입니다. 대상 화자의 짧은 음성 샘플을 기반으로 시스템은 음성 구간을 식별하고, 배경 소음과 다른 사람의 목소리를 억제해야 했으며, 화자 분리 없이 최신 잡음 제거 방식을 재현하려고 시도했습니다. 이 프로젝트는 Demucs를 기반으로, ResNet 아키텍처와 x-vector 기술에서 얻은 음성 임베딩을 추가하고, Kaldi, PyTorch, TensorFlow를 사용했습니다. 학습과 평가에는 LibriSpeech와 VoxCeleb2를 포함한 대규모 공개 데이터 세트(총 1테라바이트 이상)와 소규모 고객 데이터 세트가 사용되었습니다. 100건 이상의 실험이 수행되었고, 팀은 근거리 및 원거리 마이크 조건 모두에서 PVAD 목표 지표를 달성하여 고객 테스트 데이터에서 모델 품질을 개선했습니다. 그러나 잡음 제거기 윤곽(denoiser contour)은 시간 제한 내에 최첨단(SOTA) 수준의 결과를 달성하지 못했으며, 팀은 이 결과가 해당 접근 방식의 적용 가능성에 대한 중요한 발견이라고 간주합니다.
출처: Habr — хаб ИИ —
원문
