ApplicationsRecherche 🇷🇺 12.08.2026 09:03

PVAD : comment apprendre à l’IA à entendre la bonne personne dans une pièce bruyante

L’équipe Singularis a développé PVAD, une technologie permettant de détecter quand une personne spécifique parle dans un flux audio général, afin d’isoler sa voix tout en supprimant le bruit de fond et les autres voix. Ils ont mené plus de 100 expériences, atteignant les métriques cibles pour la détection d’activité vocale, mais n’ont pas pu reproduire les résultats de débruitage de pointe, ce qui souligne les limites de l’approche.
L'équipe Singularis a travaillé sur la PVAD (détection d'activité vocale personnelle), une technologie permettant de déterminer quand une personne spécifique parle dans un flux audio. Sur la base d'un court échantillon vocal du locuteur cible, le système devait identifier les segments de parole, supprimer le bruit de fond et les autres voix, et également tenter de reproduire une approche de débruitage de pointe sans séparation des locuteurs. Le projet utilisait Demucs comme base, augmenté d'embeddings vocaux issus d'une architecture ResNet et de la technologie x-vector, ainsi que Kaldi, PyTorch et TensorFlow. L'entraînement et l'évaluation ont utilisé de grands ensembles de données publics, dont LibriSpeech et VoxCeleb2, totalisant plus d'un téraoctet, ainsi que de petits ensembles de données clients. Plus de 100 expériences ont été menées, et l'équipe a atteint les métriques cibles pour la PVAD dans des conditions de microphone proche et lointain, améliorant la qualité du modèle sur les données de test des clients. Cependant, le contour du débruitage n'a pas pu atteindre des résultats de niveau de pointe dans le délai imparti, ce que l'équipe considère comme une découverte importante concernant l'applicabilité de l'approche.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches