एजेंटअनुप्रयोग 🇷🇺 08.08.2026 12:02

वॉयस एआई एजेंट लोगों को बीच में क्यों टोकते हैं: लाइव एपीआई पर मापा गया और रूसी सिंटैक्स नियमों से ठीक किया गया

ЯндексЯндекс OpenAIOpenAI
वॉयस एआई प्लेटफॉर्म साइलेंस टाइमर (वीएडी) का उपयोग करके उपयोगकर्ता के भाषण का अंत निर्धारित करते हैं। एक वास्तविक एपीआई पर परीक्षण से पता चला कि एआई प्रतिक्रिया से पहले 1275 मिलीसेकंड की देरी में से 1200 मिलीसेकंड केवल टाइमर की प्रतीक्षा में जाते हैं, और केवल 75 मिलीसेकंड वास्तविक मॉडल कार्य होता है। लेखक रूसी सिंटैक्स के लिए एक नियम-आधारित डिटेक्टर का प्रस्ताव करते हैं जो देरी को 316 मिलीसेकंड तक कम कर देता है, जिसमें 38 की बजाय केवल 2 रुकावटें होती हैं।
एक इंजीनियर ने यांडेक्स रियलटाइम एपीआई (जो ओपनएआई रियलटाइम के साथ संगत है) के माध्यम से एक संश्लेषित रूसी वाक्यांश का उपयोग करके आवाज एआई प्रतिक्रियाओं में देरी को मापा। उन्होंने silence_duration_ms पैरामीटर को बदला: 400 एमएस या 800 एमएस के साथ, एजेंट लगभग तुरंत प्रतिक्रिया देता था लेकिन केवल अभिवादन सुनता था, वास्तविक प्रश्न को खो देता था। 1200 एमएस के साथ, पूरा वाक्यांश पहचाना गया, लेकिन देरी 1275 एमएस थी, जिसमें से केवल 75 एमएस मॉडल प्रोसेसिंग थी। उन्होंने रूसी वाक्यविन्यास के लिए एक नियम-आधारित डिटेक्टर बनाया जो उचित मौन सीमा तय करता है: यदि उच्चारण पूर्ण होने की संभावना है तो 250 एमएस, यदि अपूर्ण है (जैसे, पूर्वसर्गों या संयोजनों के साथ समाप्त होता है) तो 1400 एमएस, और यदि अनिश्चित है तो 700 एमएस। 72 वास्तविक फोन-शैली वाक्यांशों के एक परीक्षण सेट पर, इस दृष्टिकोण ने 97% सटीकता (72 में से 70) प्राप्त की, रुकावटों को 38 से घटाकर 2 कर दिया और उत्तरों से पहले औसत मौन को 1200 एमएस से घटाकर 316 एमएस कर दिया। शेष दो विफलताएं व्यावहारिकता (जैसे, 'नहीं, आपने मुझे गलत समझा') से संबंधित हैं, जिन्हें नियम संभाल नहीं सकते; लेखक एक प्रशिक्षित शब्दार्थ मॉडल के साथ तुलना करने की योजना बना रहा है। वे संश्लेषित भाषण पर देरी मापते समय शुरुआती/अंतिम मौन को हटाने की चेतावनी भी देते हैं, अन्यथा परिणाम विकृत हो जाते हैं।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार