Waarom Voice AI-agenten mensen onderbreken: gemeten op een live API en opgelost met Russische syntaxregels
Яндекс
OpenAI
Voice AI-platforms bepalen het einde van een uiting van de gebruiker met behulp van een stiltetimer (VAD). Tests op een echte API toonden aan dat van de 1275 ms vertraging vóór een AI-antwoord, 1200 ms alleen maar wachten op de timer is, en slechts 75 ms feitelijk modelwerk. De auteur stelt een regelgebaseerde detector voor voor Russische syntax die de vertraging terugbrengt tot 316 ms, met slechts 2 onderbrekingen in plaats van 38.
Een ingenieur heeft de vertraging gemeten van AI-stemreacties met behulp van een Russische zin die is gegenereerd via de Yandex Realtime API (compatibel met OpenAI Realtime). Zij varieerden de parameter silence_duration_ms: bij 400 ms of 800 ms reageerde de agent bijna onmiddellijk, maar hoorde alleen de begroeting en miste de eigenlijke vraag. Bij 1200 ms werd de volledige zin herkend, maar was de vertraging 1275 ms, waarvan slechts 75 ms bestond uit verwerking door het model. Ze bouwden een op regels gebaseerde detector voor Russische syntaxis die het juiste stilte-drempelniveau bepaalt: 250 ms als de uiting waarschijnlijk compleet is, 1400 ms als deze onvolledig is (bijvoorbeeld eindigend op voorzetsels of voegwoorden), en 700 ms bij onzekerheid. Op een testset van 72 echte telefoonachtige zinnen behaalde deze aanpak een nauwkeurigheid van 97% (70 van de 72), waardoor het aantal onderbrekingen daalde van 38 naar 2 en de gemiddelde stilte voor antwoorden van 1200 ms naar 316 ms. De resterende twee fouten zijn pragmatisch van aard (bijvoorbeeld 'nee, je hebt me verkeerd begrepen'), die regels niet kunnen verwerken; de auteur is van plan om dit te vergelijken met een getraind semantisch model. Ze waarschuwen ook om stilte aan het begin en einde te verwijderen bij het meten van vertragingen op gesynthetiseerde spraak, anders zijn de resultaten vertekend.
Bron: Habr — хаб ИИ —
origineel
