音声AIエージェントが人を遮る理由:ライブAPIでの計測とロシア語構文ルールによる修正
Яндекс
OpenAI
音声AIプラットフォームは、ユーザーの発話終了を無音タイマー(VAD)で判定します。実際のAPIでのテストでは、AI応答までの遅延1275ミリ秒のうち、1200ミリ秒はタイマー待ちで、実際のモデル処理はわずか75ミリ秒でした。著者はロシア語の構文に基づくルールベースの検出器を提案し、遅延を316ミリ秒に短縮し、割り込みを38回から2回に削減しました。
エンジニアが、Yandex Realtime API(OpenAI Realtime互換)を介して合成されたロシア語フレーズを使用して、音声AI応答の遅延を測定しました。彼らはsilence_duration_msパラメータを変更しました:400ミリ秒または800ミリ秒では、エージェントはほぼ即座に応答しましたが、挨拶のみを聞き取り、実際の質問を聞き逃しました。1200ミリ秒では、フレーズ全体が認識されましたが、遅延は1275ミリ秒であり、そのうちモデルの処理はわずか75ミリ秒でした。彼らは、適切な無音閾値を決定するロシア語構文のルールベースの検出器を構築しました:発話が完了している可能性が高い場合は250ミリ秒、不完全な場合(前置詞や接続詞で終わる場合など)は1400ミリ秒、不確かな場合は700ミリ秒です。実際の電話風フレーズ72件のテストセットでは、このアプローチは97%の精度(72件中70件)を達成し、割り込みを38回から2回に、応答前の平均無音時間を1200ミリ秒から316ミリ秒に削減しました。残りの2つの失敗は語用論的なもの(例えば「いいえ、あなたは私を誤解しています」)であり、ルールでは処理できません。著者は、訓練された意味モデルとの比較を計画しています。また、合成音声で遅延を測定する際には、先頭と末尾の無音をトリミングするよう警告しています。そうしないと結果が歪みます。
出典: Habr — хаб ИИ —
原文
