에이전트애플리케이션 🇷🇺 08.08.2026 12:02

음성 AI 에이전트가 사람의 말을 끊는 이유: 실제 API 측정과 러시아어 구문 규칙으로 해결

ЯндексЯндекс OpenAIOpenAI
음성 AI 플랫폼은 사용자의 발화 종료를 침묵 타이머(VAD)로 판단한다. 실제 API 테스트 결과, AI 응답 전 1275ms 지연 중 1200ms는 타이머 대기이며, 실제 모델 작업은 75ms에 불과했다. 저자는 러시아어 구문 규칙 기반 감지기를 제안하여 지연을 316ms로 줄이고, 중단 횟수를 38회에서 2회로 감소시켰다.
한 엔지니어가 Yandex Realtime API(OpenAI Realtime과 호환)를 통해 합성된 러시아어 문구를 사용하여 음성 AI 응답의 지연 시간을 측정했습니다. 그들은 silence_duration_ms 매개변수를 변경했습니다: 400ms 또는 800ms에서는 에이전트가 거의 즉시 응답했지만 인사말만 듣고 실제 질문을 놓쳤습니다. 1200ms에서는 전체 문구가 인식되었지만 지연 시간은 1275ms였으며, 그중 모델 처리 시간은 75ms에 불과했습니다. 그들은 러시아어 구문에 대한 규칙 기반 탐지기를 구축하여 적절한 침묵 임계값을 결정했습니다: 발화가 완료되었을 가능성이 높으면 250ms, 불완전하면(예: 전치사나 접속사로 끝나는 경우) 1400ms, 불확실하면 700ms입니다. 72개의 실제 전화 스타일 문구로 구성된 테스트 세트에서 이 접근 방식은 97%의 정확도(72개 중 70개)를 달성했으며, 중단 횟수를 38회에서 2회로 줄이고, 응답 전 평균 침묵 시간을 1200ms에서 316ms로 줄였습니다. 나머지 두 실패는 화용론적 문제(예: '아니요, 오해하셨습니다')로, 규칙으로는 처리할 수 없습니다. 저자는 훈련된 의미론적 모델과 비교할 계획입니다. 또한 합성 음성에서 지연 시간을 측정할 때 앞뒤의 침묵을 잘라내지 않으면 결과가 왜곡될 수 있다고 경고합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스