Tác tửỨng dụng 🇷🇺 08.08.2026 12:02

Vì sao tác tử AI giọng nói ngắt lời người dùng: Đo trên API thực tế và khắc phục bằng quy tắc cú pháp tiếng Nga

ЯндексЯндекс OpenAIOpenAI
Các nền tảng AI giọng nói xác định thời điểm người dùng nói xong bằng bộ hẹn giờ im lặng (VAD). Các thử nghiệm trên một API thực tế cho thấy trong 1275 ms trễ trước phản hồi của AI, 1200 ms chỉ là chờ hẹn giờ và chỉ 75 ms là thời gian mô hình xử lý. Tác giả đề xuất một bộ phát hiện dựa trên quy tắc cú pháp tiếng Nga giúp giảm độ trễ xuống còn 316 ms với chỉ 2 lần ngắt lời thay vì 38.
Một kỹ sư đã đo độ trễ trong phản hồi AI bằng giọng nói sử dụng một cụm từ tiếng Nga được tổng hợp thông qua Yandex Realtime API (tương thích với OpenAI Realtime). Họ đã thay đổi tham số silence_duration_ms: với 400 ms hoặc 800 ms, tác nhân phản hồi gần như ngay lập tức nhưng chỉ nghe được lời chào, bỏ lỡ câu hỏi thực sự. Với 1200 ms, toàn bộ cụm từ được nhận dạng, nhưng độ trễ là 1275 ms, trong đó chỉ có 75 ms là xử lý mô hình. Họ đã xây dựng một bộ phát hiện dựa trên quy tắc cho cú pháp tiếng Nga để quyết định ngưỡng im lặng phù hợp: 250 ms nếu phát ngôn có khả năng hoàn chỉnh, 1400 ms nếu không hoàn chỉnh (ví dụ: kết thúc bằng giới từ hoặc liên từ), và 700 ms nếu không chắc chắn. Trên một tập kiểm tra gồm 72 cụm từ theo phong cách điện thoại thực tế, phương pháp này đạt độ chính xác 97% (70 trên 72), giảm số lần ngắt lời từ 38 xuống 2 và giảm thời gian im lặng trung bình trước câu trả lời từ 1200 ms xuống 316 ms. Hai thất bại còn lại là về ngữ dụng (ví dụ: 'không, bạn đã hiểu nhầm tôi'), mà các quy tắc không thể xử lý; tác giả dự định so sánh với một mô hình ngữ nghĩa đã được huấn luyện. Họ cũng cảnh báo về việc cắt bỏ khoảng im lặng ở đầu và cuối khi đo độ trễ trên giọng nói tổng hợp, nếu không kết quả sẽ bị sai lệch.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới