Por que os agentes de voz com IA interrompem as pessoas: medido em uma API ao vivo e corrigido com regras de sintaxe russa
Яндекс
OpenAI
As plataformas de voz com IA determinam o fim da fala do usuário usando um temporizador de silêncio (VAD). Testes em uma API real mostraram que, de 1275 ms de atraso antes de uma resposta da IA, 1200 ms são apenas espera pelo temporizador, e apenas 75 ms são de trabalho real do modelo. O autor propõe um detector baseado em regras para a sintaxe russa que reduz o atraso para 316 ms com apenas 2 interrupções em vez de 38.
Um engenheiro mediu o atraso nas respostas de IA de voz usando uma frase russa sintetizada através da API Yandex Realtime (compatível com OpenAI Realtime). Eles variaram o parâmetro silence_duration_ms: com 400 ms ou 800 ms, o agente respondeu quase instantaneamente, mas ouviu apenas a saudação, perdendo a pergunta real. Com 1200 ms, a frase completa foi reconhecida, mas o atraso foi de 1275 ms, dos quais apenas 75 ms eram de processamento do modelo. Eles construíram um detector baseado em regras para a sintaxe russa que decide o limite de silêncio apropriado: 250 ms se a fala provavelmente estiver completa, 1400 ms se estiver incompleta (por exemplo, terminando com preposições ou conjunções) e 700 ms se houver incerteza. Em um conjunto de teste com 72 frases reais em estilo de telefone, essa abordagem alcançou 97% de precisão (70 de 72), reduzindo as interrupções de 38 para 2 e o silêncio médio antes das respostas de 1200 ms para 316 ms. As duas falhas restantes são de pragmática (por exemplo, 'não, você me entendeu mal'), que as regras não conseguem lidar; o autor planeja comparar com um modelo semântico treinado. Eles também alertam para cortar o silêncio inicial e final ao medir atrasos em fala sintetizada, caso contrário, os resultados ficam distorcidos.
Fonte: Habr — хаб ИИ —
original
