Por qué los agentes de voz con IA interrumpen a las personas: medido en una API en vivo y corregido con reglas sintácticas del ruso
Яндекс
OpenAI
Las plataformas de IA de voz determinan el final de la intervención del usuario mediante un temporizador de silencio (VAD). Las pruebas en una API real mostraron que, de los 1275 ms de retraso antes de una respuesta de la IA, 1200 ms corresponden a la espera del temporizador, y solo 75 ms son de trabajo real del modelo. El autor propone un detector basado en reglas sintácticas del ruso que reduce el retraso a 316 ms, con solo 2 interrupciones en lugar de 38.
Un ingeniero midió el retardo en las respuestas de IA de voz utilizando una frase rusa sintetizada a través de la API Realtime de Yandex (compatible con OpenAI Realtime). Variaron el parámetro silence_duration_ms: con 400 ms u 800 ms, el agente respondía casi instantáneamente pero solo escuchaba el saludo, perdiéndose la pregunta real. Con 1200 ms, la frase completa era reconocida, pero el retraso era de 1275 ms, de los cuales solo 75 ms correspondían al procesamiento del modelo. Construyeron un detector basado en reglas para la sintaxis rusa que decide el umbral de silencio adecuado: 250 ms si la expresión es probablemente completa, 1400 ms si está incompleta (por ejemplo, termina en preposiciones o conjunciones), y 700 ms si hay incertidumbre. En un conjunto de prueba de 72 frases reales de estilo telefónico, este enfoque logró una precisión del 97% (70 de 72), reduciendo las interrupciones de 38 a 2 y el silencio promedio antes de las respuestas de 1200 ms a 316 ms. Los dos fallos restantes son de índole pragmática (por ejemplo, 'no, me has entendido mal'), que las reglas no pueden manejar; el autor planea comparar con un modelo semántico entrenado. También advierte que se debe recortar el silencio inicial y final al medir los retardos en habla sintetizada, de lo contrario los resultados están sesgados.
Fuente: Habr — хаб ИИ —
original
