FFASR लीडरबोर्ड लॉन्च: वास्तविक ध्वनिक स्थितियों में ASR मूल्यांकन के लिए बेंचमार्क
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Hugging Face और Treble Technologies ने फ़ार-फ़ील्ड ASR (FFASR) लीडरबोर्ड लॉन्च किया है, जो प्रतिध्वनि, पृष्ठभूमि शोर और माइक्रोफ़ोन दूरी जैसी यथार्थवादी दूर-क्षेत्र स्थितियों के तहत ASR मॉडल का मूल्यांकन करने वाला पहला खुला सामुदायिक-संचालित बेंचमार्क है। शुरुआती परिणाम दिखाते हैं कि कम SNR पर फ़ार-फ़ील्ड WER नियर-फ़ील्ड WER से कई गुना अधिक है, जो बेंचमार्क प्रदर्शन और वास्तविक दुनिया में तैनाती के बीच एक महत्वपूर्ण अंतर को उजागर करता है।
हगिंग फेस और ट्रेबल टेक्नोलॉजीज द्वारा बनाया गया FFASR लीडरबोर्ड, यथार्थवादी दूर-क्षेत्र ध्वनिक स्थितियों में ASR मॉडलों के मूल्यांकन के लिए पहला खुला सामुदायिक-संचालित बेंचमार्क है। यह बेंचमार्क प्रदर्शन और वास्तविक दुनिया में तैनाती के बीच लगातार बने रहने वाले अंतर को संबोधित करता है, जहां मानक निकट-क्षेत्र बेंचमार्क पर अच्छा स्कोर करने वाले मॉडल अक्सर प्रतिध्वनि, पृष्ठभूमि शोर और माइक्रोफोन दूरी के तहत काफी खराब हो जाते हैं। लीडरबोर्ड नौ स्थितियों में मॉडलों का मूल्यांकन करता है, जिनमें से चार प्राथमिक रैंकिंग स्कोर निर्धारित करते हैं। ध्वनिक डेटा ट्रेबल के हाइब्रिड सिमुलेशन इंजन का उपयोग करके उत्पन्न किया जाता है, जो विवर्तन और हस्तक्षेप जैसी घटनाओं को पकड़ने के लिए तरंग-आधारित और ज्यामितीय-ध्वनिकी मॉडलिंग को जोड़ता है। 20 से 470 घन मीटर तक के चौदह पूरी तरह से सुसज्जित कमरे शामिल हैं। WER के साथ, लीडरबोर्ड प्रत्येक सबमिशन के लिए RTFx (प्रति अनुमान सेकंड ऑडियो सेकंड) की रिपोर्ट करता है, जिसका मूल्यांकन NVIDIA L4 GPU पर किया जाता है। प्रारंभिक परिणाम दिखाते हैं कि कम SNR पर दूर-क्षेत्र WER निकट-क्षेत्र WER से कई गुना अधिक है। लीडरबोर्ड Whisper वेरिएंट, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain और हगिंग फेस मॉडल आईडी सबमिशन के माध्यम से अधिकांश अन्य ASR आर्किटेक्चर का समर्थन करता है। एक कस्टम मूल्यांकनकर्ता विकल्प अधिक जटिल अनुमान स्टैक की अनुमति देता है। भविष्य की योजनाओं में बहु-वक्ता परिदृश्य, माइक्रोफोन ऐरे मूल्यांकन और इको कैंसिलेशन शामिल हैं।
स्रोत: Hugging Face blog —
मूल
