ToepassingenOnderzoek 🇷🇺 12.08.2026 09:03

PVAD: hoe leer je AI de juiste persoon horen in een lawaaierige ruimte

Het Singularis-team ontwikkelde PVAD, een technologie om te detecteren wanneer een specifieke persoon spreekt in een algemene audiostream, met als doel diens stem te isoleren terwijl achtergrondgeluid en andere stemmen worden onderdrukt. Ze voerden meer dan 100 experimenten uit en behaalden de doelwaarden voor spraakactiviteitsdetectie, maar konden de state-of-the-art resultaten op het gebied van ruisonderdrukking niet evenaren, wat de beperkingen van de aanpak benadrukt.
Het Singularis-team werkte aan PVAD (Personal Voice Activity Detection), een technologie om te bepalen wanneer een specifieke persoon spreekt in een audiostream. Op basis van een kort stemvoorbeeld van de doelspreker moest het systeem spraaksegmenten identificeren, achtergrondgeluid en andere stemmen onderdrukken, en ook proberen om een state-of-the-art ruisonderdrukkingsaanpak zonder sprekerscheiding te repliceren. Het project gebruikte Demucs als basis, uitgebreid met stemembeddings van een ResNet-architectuur en x-vector-technologie, samen met Kaldi, PyTorch en TensorFlow. Training en evaluatie maakten gebruik van grote openbare datasets, waaronder LibriSpeech en VoxCeleb2, in totaal meer dan 1 terabyte, plus kleine klantdatasets. Er werden meer dan 100 experimenten uitgevoerd, en het team behaalde de doelmetingen voor PVAD in zowel nabije als verre microfoonomstandigheden, waardoor de modelkwaliteit op klanttestgegevens verbeterde. De ruisonderdrukker contouren konden echter niet binnen de tijdslimiet op SOTA-niveau resultaten behalen, wat het team beschouwt als een belangrijke bevinding over de toepasbaarheid van de aanpak.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws