AplicaçõesPesquisa 🇷🇺 12.08.2026 09:03

PVAD: como ensinar IA a ouvir a pessoa certa em uma sala ruidosa

A equipe Singularis desenvolveu o PVAD, uma tecnologia para detectar quando uma pessoa específica fala em um fluxo de áudio geral, visando isolar a voz dela enquanto suprime ruído de fundo e outras vozes. Eles realizaram mais de 100 experimentos, alcançando as métricas-alvo para detecção de atividade de voz, mas não conseguiram replicar os resultados de última geração (state-of-the-art) em redução de ruído, destacando os limites da abordagem.
A equipe da Singularis trabalhou no PVAD (Personal Voice Activity Detection), uma tecnologia para determinar quando uma pessoa específica fala em um fluxo de áudio. Com base em uma amostra curta de voz do locutor alvo, o sistema precisava identificar segmentos de fala, suprimir ruído de fundo e outras vozes, e também tentar replicar uma abordagem de redução de ruído de última geração sem separação de locutores. O projeto usou o Demucs como base, aumentado com incorporações de voz de uma arquitetura ResNet e tecnologia x-vector, juntamente com Kaldi, PyTorch e TensorFlow. O treinamento e a avaliação usaram grandes conjuntos de dados públicos, incluindo LibriSpeech e VoxCeleb2, totalizando mais de 1 terabyte, além de pequenos conjuntos de dados de clientes. Mais de 100 experimentos foram conduzidos, e a equipe alcançou as métricas alvo para o PVAD em condições de microfone próximo e distante, melhorando a qualidade do modelo em dados de teste de clientes. No entanto, o contorno do redutor de ruído não conseguiu atingir resultados de nível SOTA dentro do prazo, o que a equipe considera uma descoberta importante sobre a aplicabilidade da abordagem.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas