Mengapa Agen AI Suara Menyela Orang: Diukur pada API Langsung dan Diperbaiki dengan Aturan Sintaks Rusia
Яндекс
OpenAI
Platform AI suara menentukan akhir ucapan pengguna menggunakan timer hening (VAD). Pengujian pada API nyata menunjukkan bahwa dari penundaan 1275 ms sebelum respons AI, 1200 ms hanya menunggu timer, dan hanya 75 ms kerja model yang sebenarnya. Penulis mengusulkan detektor berbasis aturan untuk sintaks Rusia yang mengurangi penundaan menjadi 316 ms dengan hanya 2 interupsi, bukan 38.
Seorang insinyur mengukur penundaan respons AI suara menggunakan frasa bahasa Rusia yang disintesis melalui Yandex Realtime API (kompatibel dengan OpenAI Realtime). Mereka memvariasikan parameter silence_duration_ms: dengan 400 ms atau 800 ms, agen merespons hampir seketika tetapi hanya mendengar salam, melewatkan pertanyaan sebenarnya. Dengan 1200 ms, seluruh frasa dikenali, tetapi penundaannya 1275 ms, yang hanya 75 ms untuk pemrosesan model. Mereka membangun pendeteksi berbasis aturan untuk sintaksis Rusia yang menentukan ambang keheningan yang sesuai: 250 ms jika ucapan kemungkinan lengkap, 1400 ms jika tidak lengkap (misalnya, diakhiri dengan preposisi atau konjungsi), dan 700 ms jika tidak yakin. Pada set uji 72 frasa gaya telepon nyata, pendekatan ini mencapai akurasi 97% (70 dari 72), mengurangi interupsi dari 38 menjadi 2 dan rata-rata keheningan sebelum jawaban dari 1200 ms menjadi 316 ms. Dua kegagalan yang tersisa adalah masalah pragmatik (misalnya, 'tidak, kamu salah paham'), yang tidak dapat ditangani oleh aturan; penulis berencana membandingkan dengan model semantik yang terlatih. Mereka juga memperingatkan untuk memotong keheningan di awal dan akhir saat mengukur penundaan pada ucapan yang disintesis, jika tidak, hasilnya akan miring.
Sumber: Habr — хаб ИИ —
asli
