InvestigaciónGeneración de Medios 🇷🇺 06.08.2026 19:05

Científicos de la Universidad de San Petersburgo mejoran la capacidad de diálogo de la red neuronal

Lingüistas de la Universidad Estatal de San Petersburgo (SPbU) mejoraron la capacidad de diálogo de una red neuronal al integrar un modelo de entonación, logrando una pronunciación más natural por parte de la IA. Se espera que este avance mejore los sistemas de conversión de texto a voz utilizados en asistentes de voz y robots antropomórficos. Los resultados del estudio se publicaron en las actas de la Conferencia Internacional sobre Habla y Computación.
Lingüistas de la Universidad Estatal de San Petersburgo han mejorado la capacidad dialógica de una red neuronal incorporando un modelo de entonación, lo que hace que la pronunciación de la inteligencia artificial sea más natural y familiar para los humanos. Este desarrollo tiene como objetivo mejorar los sistemas de conversión de texto a voz utilizados en asistentes de voz y robots antropomórficos. Los resultados de la investigación se publicaron en las actas de la Conferencia Internacional sobre Habla y Computación. Los sistemas basados en IA ya pueden reemplazar total o parcialmente a los humanos en muchas tareas, especialmente en las rutinarias, pero la entonación ha sido difícil de implementar. La entonación es crucial para expresar emociones, actitudes y significado comunicativo, como distinguir una pregunta de una afirmación. Los modelos de lenguaje tradicionales a menudo producen una entonación monótona o inapropiada. Los lingüistas de la Universidad Estatal de San Petersburgo utilizaron el modelo Tacotron2 para la síntesis de texto a voz y lo entrenaron con una clasificación de entonación especializada desarrollada en esa universidad. La clasificación incluye una amplia gama de variantes de entonación, teniendo en cuenta el rango melódico, la velocidad y el tipo de oración. Estas modificaciones permitieron que la red neuronal superara las limitaciones de la entonación antinatural o monótona. En una evaluación, 42 hablantes nativos de ruso escucharon audio sintetizado y generalmente lo encontraron natural, con algunos artefactos menores. En un segundo experimento, los participantes pudieron identificar frases interrogativas con mayor facilidad. Los investigadores sugieren un mayor ajuste fino con variantes emocionales y estilísticas para mejorar la calidad.
Fuente: CNews — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas