RechercheGénération Média 🇷🇺 06.08.2026 19:05

Des scientifiques de l'Université de Saint-Pétersbourg améliorent la capacité de dialogue des réseaux neuronaux

Des linguistes de l'Université d'État de Saint-Pétersbourg (SPbU) ont amélioré la capacité de dialogue d'un réseau neuronal en intégrant un modèle d'intonation, rendant la prononciation de l'IA plus naturelle. Ce développement devrait améliorer les systèmes de synthèse vocale utilisés dans les assistants vocaux et les robots anthropomorphes. Les résultats de l'étude ont été publiés dans les actes de la Conférence internationale sur la parole et l'ordinateur.
Des linguistes de l'Université d'État de Saint-Pétersbourg ont amélioré la capacité de dialogue d'un réseau neuronal en intégrant un modèle d'intonation, ce qui rend la prononciation de l'IA plus naturelle et plus familière aux humains. Ce développement vise à améliorer les systèmes de synthèse vocale utilisés dans les assistants vocaux et les robots anthropomorphes. Les résultats de la recherche ont été publiés dans les actes de la Conférence internationale sur la parole et l'ordinateur. Les systèmes basés sur l'IA peuvent déjà remplacer entièrement ou partiellement les humains dans de nombreuses tâches, en particulier les tâches routinières, mais l'intonation a été difficile à mettre en œuvre. L'intonation est cruciale pour exprimer les émotions, l'attitude et le sens communicatif, comme distinguer une question d'une affirmation. Les modèles de langage traditionnels produisent souvent une intonation monotone ou inappropriée. Les linguistes de l'Université d'État de Saint-Pétersbourg ont utilisé le modèle Tacotron2 pour la synthèse vocale et l'ont entraîné avec une classification d'intonation spécialisée développée à l'Université d'État de Saint-Pétersbourg. La classification comprend une large gamme de variantes d'intonation, tenant compte de la plage mélodique, de la vitesse et du type de phrase. Ces modifications ont permis au réseau neuronal de surmonter les limitations d'une intonation non naturelle ou monotone. Dans une évaluation, 42 locuteurs natifs russes ont écouté de l'audio synthétisé et l'ont généralement trouvé naturel, avec quelques artefacts mineurs. Dans une deuxième expérience, les participants ont pu identifier plus facilement les phrases interrogatives. Les chercheurs suggèrent d'affiner davantage avec des variantes émotionnelles et stylistiques pour améliorer la qualité.
Source: CNews — original
Nos articles précédents sur ce sujet ↓
Infos fraîches