PVAD: Wie man KI beibringt, in einem lauten Raum die richtige Person zu hören
Das Singularis-Team entwickelte PVAD, eine Technologie zur Erkennung, wann eine bestimmte Person in einem allgemeinen Audiostream spricht, mit dem Ziel, deren Stimme zu isolieren und dabei Hintergrundgeräusche und andere Stimmen zu unterdrücken. Sie führten über 100 Experimente durch und erreichten die Zielmetriken für die Erkennung von Sprachaktivität, konnten jedoch die Ergebnisse der Spitzenwerte bei der Rauschunterdrückung nicht reproduzieren, was die Grenzen des Ansatzes aufzeigt.
Das Singularis-Team arbeitete an PVAD (Personal Voice Activity Detection), einer Technologie zur Bestimmung, wann eine bestimmte Person in einem Audiostream spricht. Basierend auf einer kurzen Sprachprobe des Zielsprechers musste das System Sprachsegmente identifizieren, Hintergrundgeräusche und andere Stimmen unterdrücken und zusätzlich versuchen, einen modernen Ansatz zur Rauschunterdrückung ohne Sprechertrennung zu replizieren. Das Projekt verwendete Demucs als Basis, erweitert um Sprach-Embeddings aus einer ResNet-Architektur und x-Vector-Technologie, sowie Kaldi, PyTorch und TensorFlow. Für Training und Evaluierung wurden große öffentliche Datensätze wie LibriSpeech und VoxCeleb2 mit insgesamt über einem Terabyte sowie kleine Kundendatensätze verwendet. Es wurden mehr als 100 Experimente durchgeführt, und das Team erreichte die Zielmetriken für PVAD sowohl unter Nah- als auch unter Fernmikrofonbedingungen, wodurch die Modellqualität auf Kundentestdaten verbessert wurde. Der Denoiser-Ansatz konnte jedoch innerhalb des Zeitlimits keine Ergebnisse auf State-of-the-Art-Niveau erzielen, was das Team als wichtige Erkenntnis über die Anwendbarkeit des Ansatzes betrachtet.
Quelle: Habr — хаб ИИ —
Original
