Sesli Yapay Zekâ Ajanlarının İnsanların Sözünü Kesme Nedeni: Canlı API Üzerinde Ölçüldü ve Rusça Sözdizimi Kurallarıyla Çözüldü
Яндекс
OpenAI
Sesli yapay zekâ platformları, kullanıcının konuşmasının sonunu bir sessizlik zamanlayıcısı (VAD) kullanarak belirler. Gerçek bir API üzerinde yapılan testler, yapay zekâ yanıtından önceki 1275 ms'lik gecikmenin 1200 ms'sinin sadece zamanlayıcıyı beklemekten kaynaklandığını, yalnızca 75 ms'nin gerçek model çalışması olduğunu gösterdi. Yazar, Rusça sözdizimi için kural tabanlı bir algılayıcı öneriyor ve bu, gecikmeyi 316 ms'ye düşürürken, 38 yerine sadece 2 kesintiye neden oluyor.
Bir mühendis, Yandex Realtime API (OpenAI Realtime ile uyumlu) üzerinden sentezlenmiş bir Rusça ifade kullanarak sesli yapay zeka yanıtlarındaki gecikmeyi ölçtü. silence_duration_ms parametresini değiştirdi: 400 ms veya 800 ms ile ajan neredeyse anında yanıt verdi ancak yalnızca selamlamayı duydu ve asıl soruyu kaçırdı. 1200 ms ile tam ifade tanındı, ancak gecikme 1275 ms idi ve bunun yalnızca 75 ms'si model işleme süresiydi. Rusça sözdizimi için, uygun sessizlik eşiğine karar veren kural tabanlı bir dedektör geliştirdiler: ifade muhtemelen tamamlandıysa 250 ms, tamamlanmadıysa (örneğin, edat veya bağlaçlarla bitiyorsa) 1400 ms ve belirsizse 700 ms. 72 gerçek telefon tarzı ifadeden oluşan bir test setinde bu yaklaşım %97 doğruluk elde etti (72 üzerinden 70), kesintileri 38'den 2'ye ve yanıtlardan önceki ortalama sessizliği 1200 ms'den 316 ms'ye düşürdü. Kalan iki başarısızlık, kuralların ele alamadığı edimbilimsel durumlardır (örneğin, 'hayır, beni yanlış anladınız'); yazar, eğitilmiş bir anlamsal modelle karşılaştırmayı planlıyor. Ayrıca, sentezlenmiş konuşmada gecikmeleri ölçerken baştaki ve sondaki sessizliği kırpmaları konusunda uyarıyor, aksi takdirde sonuçlar yanıltıcı olur.
Kaynak: Habr — хаб ИИ —
orijinal
