SovelluksetTutkimus 🇷🇺 12.08.2026 09:03

PVAD: Kuinka opettaa tekoälylle oikean henkilön kuuleminen meluisessa huoneessa

Singularis-tiimi kehitti PVAD-teknologian, joka tunnistaa, milloin tietty henkilö puhuu yleisessä äänivirrassa, tavoitteenaan eristää hänen äänensä vaimentaen samalla taustamelua ja muita ääniä. He suorittivat yli 100 kokeilua ja saavuttivat tavoitearvot äänenaktiviteetin tunnistuksessa, mutta eivät pystyneet toistamaan huipputason denoising-tuloksia, mikä korostaa lähestymistavan rajoitteita.
Singularis-tiimi työskenteli PVAD-tekniikan (Personal Voice Activity Detection, henkilökohtainen puheaktivaation tunnistus) parissa, jonka avulla voidaan määrittää, milloin tietty henkilö puhuu äänivirrassa. Järjestelmän piti tunnistaa puhejaksot lyhyen kohdehenkilön ääninäytteen perusteella, vaimentaa taustamelu ja muut äänet sekä myös yrittää jäljitellä huipputason kohinanpoistomenetelmää ilman puhujan erottelua. Projektissa käytettiin Demucsia pohjana, jota täydennettiin ResNet-arkkitehtuuriin ja x-vektoriteknologiaan perustuvilla äänivektoreilla sekä Kaldi-, PyTorch- ja TensorFlow-työkaluilla. Harjoittelussa ja arvioinnissa käytettiin suuria julkisia tietoaineistoja, kuten LibriSpeech ja VoxCeleb2, yhteensä yli teratavu, sekä pieniä asiakastietoaineistoja. Kokeita tehtiin yli 100, ja tiimi saavutti PVAD:lle asetetut tavoitemittarit sekä lähi- että kaukomikrofoniolosuhteissa, parantaen mallin laatua asiakkaiden testiaineistoilla. Kohinanpoistimen muotoilu ei kuitenkaan yltänyt SOTA-tason tuloksiin aikarajan puitteissa, minkä tiimi näkee tärkeänä havaintona lähestymistavan sovellettavuudesta.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset