रियल वर्ल्ड वॉइस ईक्यू पेश किया गया: वॉइस एआई गुणवत्ता मूल्यांकन के लिए एक नया बेंचमार्क
Hume AI
ह्यूम एआई ने रियल वर्ल्ड वॉइस ईक्यू लॉन्च किया, जो मानव-स्तरीय वॉइस इंटरैक्शन के मूल्यांकन के लिए एक बेंचमार्क है। दस लाख से अधिक मानव रेटिंग पर आधारित, यह 40 से अधिक मॉडलों को 60 से अधिक मीट्रिक्स पर कवर करता है, जिनमें ASR (ऑटोमैटिक स्पीच रिकॉग्निशन), TTS (टेक्स्ट-टू-स्पीच), S2S (स्पीच-टू-स्पीच), और स्पीच अंडरस्टैंडिंग शामिल हैं। बेंचमार्क ने खुलासा किया कि कोई भी एकल मॉडल सभी श्रेणियों में उत्कृष्ट नहीं है और वर्तमान सिस्टम की भावना और संदर्भ पहचान में कमजोरियों को उजागर किया।
ह्यूम एआई की टीम ने रियल वर्ल्ड वॉयसईक्यू बेंचमार्क पेश किया है, जिसे मानव दृष्टिकोण से वॉयस एआई की गुणवत्ता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह 40 से अधिक प्रमुख मालिकाना और ओपन-सोर्स वॉयस एआई मॉडल का 15+ प्रमुख आयामों और 60+ मेट्रिक्स पर मूल्यांकन करता है, जिसमें स्वचालित वाक् पहचान (एएसआर), टेक्स्ट-टू-स्पीच (टीटीएस), स्पीच-टू-स्पीच (एस2एस), और वाक् समझ शामिल है। बेंचमार्क 10 लाख से अधिक व्यक्तिगत मानव मूल्यांकनों पर आधारित है, जो विविध जनसांख्यिकीय समूहों, भाषण शैलियों और ध्वनिक वातावरणों से एकत्र किए गए हैं। वर्तमान संस्करण में 785,000 टीटीएस मूल्यांकन और 48,000 एस2एस मूल्यांकन शामिल हैं, जो इसे वॉयस एआई गुणवत्ता के सबसे बड़े मानव-इन-द-लूप अध्ययनों में से एक बनाता है। मूल्यांकन कैरोस प्लेटफ़ॉर्म पर किए गए थे। परिणामों के अनुसार, कोई भी एकल सिस्टम सभी आठ क्षमता समूहों में शीर्ष पांच में नहीं है, जो इस बात पर प्रकाश डालता है कि कोई एक 'सर्वश्रेष्ठ' वॉयस मॉडल नहीं है। स्पीच-टू-स्पीच मॉडल में सबसे अधिक अंतर देखा गया: कुछ ने भावनाओं को पहचानने में अच्छा प्रदर्शन किया लेकिन स्वाभाविक रूप से प्रतिक्रिया नहीं दे सके। यह पता चला कि ऑडियो तक पहुंच यह गारंटी नहीं देती कि एजेंट अभिभाषण संबंधी जानकारी का उपयोग करते हैं—कई सिस्टम ट्रांसक्रिप्ट पर निर्भर रहते हैं, स्वर, विराम, हिचकिचाहट, उतार-चढ़ाव और आवाज़ की मात्रा को अनदेखा करते हैं। बेंचमार्क ने यह भी खुलासा किया कि मॉडल उच्चारण वाली वाणी, अतिव्यापी आवाज़ों, भावनाओं, पृष्ठभूमि शोर और लंबी बातचीत के साथ खराब प्रदर्शन करते हैं। शोर वाले भाषण के लिए शब्द त्रुटि दर संगीत पृष्ठभूमि की तुलना में लगभग चार गुना अधिक थी। इसके अतिरिक्त, कुछ मॉडल मानक बेंचमार्क के लिए अनुकूलित प्रतीत होते हैं, संदर्भ ट्रांसक्रिप्ट से ज्ञात त्रुटियों को पुन: उत्पन्न करते हैं। प्रशिक्षित मानव मूल्यांकनकर्ताओं के साथ अग्रणी स्पीच लैंग्वेज मॉडल (एसएलएम) की तुलना से पता चला कि सहमति स्पष्ट सही उत्तर वाले कार्यों पर सबसे अधिक है लेकिन व्यक्तिपरक मूल्यांकन पर घट जाती है—उदाहरण के लिए, किसी आवाज़ को अभिनय भूमिका से मिलाना या पहचान बनाए रखना। स्वचालित मूल्यांकनकर्ता अभी तक मनुष्यों की जगह लेने में सक्षम नहीं हैं जब निर्णय ध्वनिक संदर्भ और सामाजिक व्याख्या पर निर्भर करता है।
स्रोत: Hugging Face blog —
मूल
