PVAD: как научить ИИ слышать нужного человека в шумном помещении
Команда Singularis разработала технологию PVAD для определения момента, когда говорит конкретный человек в общем аудиопотоке, с целью изоляции его голоса при подавлении фонового шума и других голосов. Они провели более 100 экспериментов, достигнув целевых показателей обнаружения речевой активности, но не смогли воспроизвести результаты шумоподавления уровня SOTA (State of the Art), что подчеркивает ограничения данного подхода.
Команда Singularis работала над технологией PVAD (Personal Voice Activity Detection — обнаружение речевой активности конкретного человека), предназначенной для определения моментов, когда в аудиопотоке говорит определенный человек. На основе короткого образца голоса целевого диктора система должна была выделять речевые сегменты, подавлять фоновый шум и чужие голоса, а также пытаться воспроизвести
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
