AgentsApplications 🇷🇺 08.08.2026 12:02

Pourquoi les agents vocaux d'IA interrompent les gens : mesuré sur une API en direct et corrigé avec des règles de syntaxe russe

ЯндексЯндекс OpenAIOpenAI
Les plateformes d'IA vocale déterminent la fin de l'énoncé d'un utilisateur à l'aide d'un minuteur de silence (détection d'activité vocale, VAD). Des tests sur une API réelle ont montré que sur un délai de 1275 millisecondes avant une réponse de l'IA, 1200 millisecondes sont simplement consacrées à l'attente du minuteur, et seulement 75 millisecondes sont le travail réel du modèle. L'auteur propose un détecteur basé sur des règles pour la syntaxe russe qui réduit le délai à 316 millisecondes avec seulement 2 interruptions au lieu de 38.
Un ingénieur a mesuré le délai des réponses vocales d'IA en utilisant une phrase russe synthétisée via l'API Yandex Realtime (compatible avec OpenAI Realtime). Il a fait varier le paramètre silence_duration_ms : avec 400 ms ou 800 ms, l'agent répondait presque instantanément mais n'entendait que la salutation, manquant la question réelle. Avec 1200 ms, la phrase complète était reconnue, mais le délai était de 1275 ms, dont seulement 75 ms pour le traitement du modèle. Il a construit un détecteur basé sur des règles pour la syntaxe russe qui décide du seuil de silence approprié : 250 ms si l'énoncé est probablement complet, 1400 ms s'il est incomplet (par exemple, se terminant par des prépositions ou des conjonctions), et 700 ms en cas d'incertitude. Sur un ensemble de test de 72 phrases de style téléphonique réelles, cette approche a atteint une précision de 97 % (70 sur 72), réduisant les interruptions de 38 à 2 et le silence moyen avant les réponses de 1200 ms à 316 ms. Les deux échecs restants relèvent de la pragmatique (par exemple, « non, tu m'as mal compris »), que les règles ne peuvent pas gérer ; l'auteur prévoit de comparer avec un modèle sémantique entraîné. Il avertit également de supprimer le silence initial et final lors de la mesure des délais sur la parole synthétisée, sinon les résultats sont faussés.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches