AplicacionesInvestigación 🇷🇺 12.08.2026 09:03

PVAD: Cómo Enseñar a la IA a Escuchar a la Persona Correcta en una Habitación Ruidosa

El equipo de Singularis desarrolló PVAD, una tecnología para detectar cuándo una persona específica habla en un flujo de audio general, con el objetivo de aislar su voz mientras se suprime el ruido de fondo y otras voces. Realizaron más de 100 experimentos, logrando las métricas objetivo para la detección de actividad de voz, pero no pudieron replicar los resultados de última generación (state-of-the-art) en cuanto a la reducción de ruido, lo que resalta los límites del enfoque.
El equipo de Singularis trabajó en PVAD (detección de actividad de voz personal), una tecnología para determinar cuándo habla una persona específica en un flujo de audio. Basándose en una muestra de voz corta del hablante objetivo, el sistema tenía que identificar segmentos de habla, suprimir el ruido de fondo y otras voces, y también intentar replicar un enfoque de eliminación de ruido de última generación sin separación de hablantes. El proyecto utilizó Demucs como base, aumentado con incrustaciones de voz de una arquitectura ResNet y tecnología x-vector, junto con Kaldi, PyTorch y TensorFlow. El entrenamiento y la evaluación utilizaron grandes conjuntos de datos públicos, incluidos LibriSpeech y VoxCeleb2, que suman más de 1 terabyte, además de pequeños conjuntos de datos de clientes. Se realizaron más de 100 experimentos y el equipo alcanzó las métricas objetivo para PVAD en condiciones de micrófono cercano y lejano, mejorando la calidad del modelo en los datos de prueba de los clientes. Sin embargo, el contorno del eliminador de ruido no pudo lograr resultados de nivel SOTA dentro del límite de tiempo, lo que el equipo considera un hallazgo importante sobre la aplicabilidad del enfoque.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas