研究メディア生成 🇷🇺 06.08.2026 19:05

サンクトペテルブルク大学の科学者、ニューラルネットワークの対話能力を向上

サンクトペテルブルク国立大学(SPbU)の言語学者たちは、イントネーションモデルを組み込むことでニューラルネットワークの対話能力を向上させ、AIの発音をより自然なものにしました。この開発は、音声アシスタントや人間型ロボットで使用されるテキスト読み上げシステムの強化につながると期待されています。研究結果は、国際音声コンピュータ会議の論文集に掲載されました。
サンクトペテルブルク国立大学の言語学者たちは、韻律モデルを組み込むことでニューラルネットワークの対話能力を向上させ、AIの発音をより自然で人間にとって親しみやすいものにしました。この開発は、音声アシスタントや人型ロボットで使用される音声合成システムを改善することを目的としています。研究成果は、国際会議「音声とコンピュータ」の論文集に掲載されました。AIベースのシステムは、多くのタスク、特に定型的なタスクにおいて、すでに人間を完全にまたは部分的に代替できますが、韻律の実装は難しいものでした。韻律は、感情、態度、およびコミュニケーション上の意味(疑問文と平叙文の区別など)を表現するために不可欠です。従来の言語モデルは、単調または不適切な韻律を生成することがよくあります。SPbUの言語学者たちは、テキスト音声合成にTacotron2モデルを使用し、SPbUで開発された専門の韻律分類法を用いて訓練しました。この分類法には、旋律範囲、速度、文のタイプを考慮した、広範囲の韻律バリアントが含まれます。これらの修正により、ニューラルネットワークは不自然で単調な韻律という限界を克服できました。評価では、42人のロシア語ネイティブスピーカーが合成音声を聴き、いくつかの軽微な人工物があるものの、概ね自然であると感じました。2番目の実験では、参加者は疑問文をより簡単に識別できました。研究者たちは、感情表現や文体のバリアントでさらに微調整することで、品質を向上できると示唆しています。
出典: CNews — 原文
関連記事 ↓
新着ニュース