रूसी आईटी डिक्टेशन के लिए 23 एएसआर मॉडलों का बेंचमार्क: मेरी मार्च की सिफारिश पुरानी हो चुकी है
OpenAI
एक डेवलपर ने रूसी आईटी डिक्टेशन के लिए वॉयस-टू-टेक्स्ट मॉडलों का पुनर्मूल्यांकन किया, 60 से अधिक कॉन्फ़िगरेशन में 23 एएसआर मॉडलों का परीक्षण किया, जिसमें 100,000 रन शामिल थे। उन्होंने पाया कि ब्रीज़ एएसआर, एक अप्रत्याशित खोज, व्हिस्पर लार्ज वी3 के बराबर या उससे बेहतर प्रदर्शन करता है, जिससे सिफारिश अद्यतन हुई है। बेंचमार्क में एक समग्र मीट्रिक क्यू पेश किया गया है, जो डब्ल्यूईआर (शब्द त्रुटि दर), विराम चिह्न सटीकता, और एक नए अंग्रेज़ी संरक्षण सूचकांक (ईपीआई) को जोड़ता है, जो उन मॉडलों को पुरस्कृत करता है जो अंग्रेज़ी शब्दों को लैटिन लिपि में रखते हैं।
मार्च में, लेखक ने रूसी आईटी डिक्टेशन के लिए व्हिस्पर लार्ज v3 की सिफारिश की थी, लेकिन बाद में ब्रीज़ एएसआर की खोज की, जो ताइवानी मंदारिन के लिए अनुकूलित एक मॉडल है जिसमें कोड-स्विचिंग का समर्थन है, और यह कम से कम उतना ही अच्छा प्रदर्शन करता है। इसे सत्यापित करने के लिए, उन्होंने एक कठोर बेंचमार्क बनाया: 60 से अधिक कॉन्फ़िगरेशन में 23 मॉडल, रूसी-अंग्रेज़ी आईटी कॉर्पस पर 100,000 से अधिक रन, आरटीएक्स 5070 टीआई पर 120+ घंटे का अनुमान। कॉर्पस में दो वक्ता (लेखक और उनकी पत्नी) शामिल हैं जो अंग्रेज़ी आईटी शब्दों के विभिन्न घनत्वों के साथ लंबे पाठ पढ़ते हैं। समग्र मीट्रिक क्यू (0.65 डब्ल्यूईआर + 0.10 पंक्चुएशन + 0.25 ईपीआई) शब्द सटीकता, विराम चिह्न गुणवत्ता और अंग्रेज़ी शब्दों के लैटिन लिपि में संरक्षण को संतुलित करता है। डब्ल्यूईआर को सामान्यीकृत किया गया है ताकि लिप्यंतरण को दंडित न किया जाए, जबकि ईपीआई विहित अंग्रेज़ी रूपों को पुरस्कृत करता है और आंशिक रूप से अपूर्ण लैटिन प्रतिधारण को श्रेय देता है। परिणाम बताते हैं कि ब्रीज़ एएसआर इस बेंचमार्क पर व्हिस्पर लार्ज v3 से बेहतर प्रदर्शन करता है, जिससे मार्च की सिफारिश पुरानी हो जाती है। लेखक ने कई विराम चिह्न प्रॉम्प्ट का भी परीक्षण किया और पाया कि एक कस्टम प्रॉम्प्ट विराम चिह्न में काफी सुधार करता है। इंटरैक्टिव बेंचमार्क पृष्ठ विभिन्न डिक्टेशन परिदृश्यों के अनुरूप वेट समायोजित करने की अनुमति देता है।
स्रोत: Habr — хаб ML —
मूल
