PVAD: Cara Mengajari AI untuk Mendengar Orang yang Tepat di Ruangan yang Bising
Tim Singularis mengembangkan PVAD, sebuah teknologi untuk mendeteksi ketika orang tertentu berbicara dalam aliran audio umum, dengan tujuan mengisolasi suara mereka sambil menekan kebisingan latar belakang dan suara lainnya. Mereka menjalankan lebih dari 100 eksperimen, mencapai metrik target untuk deteksi aktivitas suara, tetapi tidak dapat mereplikasi hasil denoising canggih, menyoroti keterbatasan pendekatan tersebut.
Tim Singularis mengerjakan PVAD (Personal Voice Activity Detection), sebuah teknologi untuk menentukan kapan orang tertentu berbicara dalam aliran audio. Berdasarkan sampel suara pendek dari pembicara target, sistem harus mengidentifikasi segmen ucapan, menekan kebisingan latar belakang dan suara lainnya, serta juga mencoba meniru pendekatan denoising terbaru tanpa pemisahan pembicara. Proyek ini menggunakan Demucs sebagai basis, ditambah dengan penyematan suara dari arsitektur ResNet dan teknologi x-vector, bersama dengan Kaldi, PyTorch, dan TensorFlow. Pelatihan dan evaluasi menggunakan dataset publik besar termasuk LibriSpeech dan VoxCeleb2, total lebih dari 1 terabyte, plus dataset kecil pelanggan. Lebih dari 100 eksperimen dilakukan, dan tim mencapai metrik target untuk PVAD dalam kondisi mikrofon dekat dan jauh, meningkatkan kualitas model pada data uji pelanggan. Namun, kontur denoiser tidak dapat mencapai hasil tingkat SOTA (state-of-the-art) dalam batas waktu, yang dianggap tim sebagai temuan penting tentang penerapan pendekatan tersebut.
Sumber: Habr — хаб ИИ —
asli
