Cientistas da Universidade de São Petersburgo melhoram a capacidade de diálogo da rede neural
Linguistas da Universidade Estatal de São Petersburgo (SPbU) melhoraram a capacidade de diálogo de uma rede neural incorporando um modelo de entonação, tornando a pronúncia da IA mais natural. Espera-se que o desenvolvimento aprimore os sistemas de conversão de texto em fala usados em assistentes de voz e robôs antropomórficos. Os resultados do estudo foram publicados nos anais da Conferência Internacional sobre Fala e Computador.
Linguistas da Universidade Estadual de São Petersburgo melhoraram a capacidade de diálogo de uma rede neural ao incorporar um modelo de entonação, o que torna a pronúncia da IA mais natural e familiar aos humanos. Esse desenvolvimento visa melhorar os sistemas de conversão de texto em fala usados em assistentes de voz e robôs antropomórficos. Os resultados da pesquisa foram publicados nos anais da Conferência Internacional sobre Fala e Computador. Sistemas baseados em IA já podem substituir total ou parcialmente os humanos em muitas tarefas, especialmente as rotineiras, mas a entonação tem sido difícil de implementar. A entonação é crucial para expressar emoções, atitudes e significado comunicativo, como distinguir uma pergunta de uma afirmação. Modelos de linguagem tradicionais frequentemente produzem entonação monótona ou inadequada. Os linguistas da Universidade Estadual de São Petersburgo usaram o modelo Tacotron2 para síntese de texto em fala e o treinaram com uma classificação especializada de entonação desenvolvida na universidade. A classificação inclui uma ampla gama de variantes de entonação, considerando a extensão melódica, a velocidade e o tipo de frase. Essas modificações permitiram que a rede neural superasse as limitações de entonação não natural ou monótona. Em uma avaliação, 42 falantes nativos de russo ouviram áudio sintetizado e, em geral, o consideraram natural, com alguns pequenos artefatos. Em um segundo experimento, os participantes conseguiram identificar frases interrogativas com mais facilidade. Os pesquisadores sugerem um ajuste fino adicional com variantes emocionais e estilísticas para melhorar a qualidade.
Fonte: CNews —
original
