OnderzoekMediageneratie 🇷🇺 06.08.2026 19:05

Wetenschappers van de Universiteit van St. Petersburg verbeteren de dialoogvaardigheid van een neuraal netwerk

Taalkundigen aan de Staatsuniversiteit van St. Petersburg (SPbU) hebben de dialoogvaardigheid van een neuraal netwerk verbeterd door een intonatiemodel in te bedden, waardoor de uitspraak van de AI natuurlijker wordt. De ontwikkeling zou tekst-naar-spraaksystemen, die worden gebruikt in spraakassistenten en antropomorfe robots, moeten verbeteren. De onderzoeksresultaten zijn gepubliceerd in de proceedings van de International Conference on Speech and Computer.
Linguïsten van de Staatsuniversiteit van Sint-Petersburg hebben de dialoogvaardigheid van een neuraal netwerk verbeterd door een intonatiemodel in te bouwen, waardoor de uitspraak van de AI natuurlijker en vertrouwder wordt voor mensen. Deze ontwikkeling is gericht op het verbeteren van tekst-naar-spraaksystemen die worden gebruikt in spraakassistenten en antropomorfe robots. De onderzoeksresultaten zijn gepubliceerd in de proceedings van de International Conference on Speech and Computer. Op AI gebaseerde systemen kunnen mensen al volledig of gedeeltelijk vervangen bij veel taken, vooral routinematige, maar intonatie was moeilijk te implementeren. Intonatie is cruciaal voor het uiten van emoties, houding en communicatieve betekenis, zoals het onderscheiden van een vraag van een bewering. Traditionele taalmodellen produceren vaak monotone of ongepaste intonatie. De linguïsten van de Staatsuniversiteit van Sint-Petersburg gebruikten het Tacotron2-model voor tekst-naar-spraaksynthese en trainden het met een gespecialiseerde intonatieclassificatie die aan de Staatsuniversiteit van Sint-Petersburg is ontwikkeld. De classificatie omvat een breed scala aan intonatievarianten, rekening houdend met melodisch bereik, snelheid en zinstype. Deze aanpassingen stelden het neuraal netwerk in staat om beperkingen van onnatuurlijke of monotone intonatie te overwinnen. In een evaluatie luisterden 42 moedertaalsprekers van het Russisch naar gesynthetiseerde audio en vonden het over het algemeen natuurlijk, met enkele kleine artefacten. In een tweede experiment konden deelnemers vragende zinnen gemakkelijker identificeren. De onderzoekers suggereren verdere verfijning met emotionele en stilistische varianten om de kwaliteit te verbeteren.
Bron: CNews — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws