アプリケーション研究 🇷🇺 12.08.2026 09:03

PVAD:雑音の多い部屋でAIに正しい人の声を聞き分けさせる方法

Singularisチームは、一般的な音声ストリーム内で特定の人物が話すタイミングを検出する技術PVADを開発し、背景ノイズや他の声を抑えつつその人の声に焦点を当てることを目指しました。彼らは100以上の実験を行い、音声活動検出の目標指標を達成しましたが、最先端(SOTA)のノイズ除去結果を再現することはできず、このアプローチの限界が浮き彫りになりました。
シンギュラリスチームは、オーディオストリーム内で特定の人物が話しているタイミングを判定する技術であるPVAD(パーソナル音声活動検出)に取り組みました。対象話者の短い音声サンプルに基づき、システムは音声セグメントを特定し、背景ノイズや他の話者の声を抑制し、さらに話者分離を行わずに最先端のノイズ除去アプローチを再現することも試みました。このプロジェクトでは、ベースとしてDemucsを使用し、ResNetアーキテクチャとx-vector技術による音声埋め込みを追加し、Kaldi、PyTorch、TensorFlowも利用しました。トレーニングと評価には、LibriSpeechやVoxCeleb2などの大規模な公開データセット(合計1テラバイト以上)と、小規模な顧客データセットを使用しました。100以上の実験が行われ、チームは近接および遠方のマイク条件下の両方でPVADの目標指標を達成し、顧客テストデータにおけるモデルの品質を向上させました。しかし、ノイズ除去器の輪郭は期限内に最先端レベル(SOTA)の結果を達成できず、チームはこれをアプローチの適用可能性に関する重要な発見と考えています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース