العواملالتطبيقات 🇷🇺 08.08.2026 12:02

لماذا تقاطع وكلاء الصوت بالذكاء الاصطناعي الناس: قياس على واجهة برمجة تطبيقات حية وإصلاح بقواعد النحو الروسية

ЯндексЯндекс OpenAIOpenAI
تحدد منصات وكلاء الصوت نهاية حديث المستخدم باستخدام مؤقت صمت (كشف النشاط الصوتي). أظهرت اختبارات على واجهة برمجة تطبيقات حقيقية أن من أصل 1275 مللي ثانية تأخير قبل استجابة الذكاء الاصطناعي، 1200 مللي ثانية هي مجرد انتظار للمؤقت، و75 مللي ثانية فقط هي عمل النموذج الفعلي. يقترح المؤلف كاشفًا قائمًا على القواعد للنحو الروسي يقلل التأخير إلى 316 مللي ثانية مع مقاطعتين فقط بدلاً من 38.
قام مهندس بقياس التأخير في استجابات الذكاء الاصطناعي الصوتي باستخدام عبارة روسية مُصنّعة عبر Yandex Realtime API (المتوافقة مع OpenAI Realtime). وقام بتغيير معامل silence_duration_ms: مع 400 مللي ثانية أو 800 مللي ثانية، استجاب الوكيل بشكل فوري تقريبًا لكنه سمع التحية فقط، وفاته السؤال الفعلي. مع 1200 مللي ثانية، تم التعرف على العبارة كاملة، لكن التأخير كان 1275 مللي ثانية، منها 75 مللي ثانية فقط لمعالجة النموذج. وقام ببناء كاشف قائم على القواعد لبناء الجملة الروسية يحدد عتبة الصمت المناسبة: 250 مللي ثانية إذا كان الكلام مكتملًا على الأرجح، و1400 مللي ثانية إذا كان غير مكتمل (على سبيل المثال، ينتهي بحروف الجر أو أدوات العطف)، و700 مللي ثانية إذا كان غير مؤكد. على مجموعة اختبار من 72 عبارة حقيقية بأسلوب الهاتف، حقق هذا النهج دقة 97% (70 من 72)، مما قلل الانقطاعات من 38 إلى 2، ومتوسط الصمت قبل الإجابات من 1200 مللي ثانية إلى 316 مللي ثانية. الحالتان المتبقيتان من الفشل هما حالات براغماتية (مثل "لا، لقد أسأت فهمي")، والتي لا يمكن للقواعد معالجتها؛ ويخطط المؤلف للمقارنة مع نموذج دلالي مُدرَّب. كما يحذر من ضرورة قصّ الصمت في البداية والنهاية عند قياس التأخيرات على الكلام المُصنَّع، وإلا تكون النتائج منحرفة.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة