शोध 🇷🇺 26.07.2026 19:05

रूसी-कज़ाख कोड-स्विचिंग अनुवाद के लिए सिंथेटिक डेटा उत्पन्न करना

MetaMeta
MWS AI और कई विश्वविद्यालयों के शोधकर्ताओं ने रूसी-कज़ाख कोड-स्विचिंग (भाषाओं का मिश्रण) के अनुवाद के लिए सिंथेटिक समानांतर कॉर्पोरा उत्पन्न करने की एक विधि विकसित की। SimAlign-आधारित शब्द प्रतिस्थापन का उपयोग करके, उन्होंने NLLB-3.3B जैसे मॉडलों को फाइन-ट्यून किया, जिससे मानव-मूल्यांकित स्कोर 3.09/5 प्राप्त हुआ, जो सिंथेटिक डेटा की सीमाओं के बावजूद वाणिज्यिक प्रणालियों (2.80-3.49) से बेहतर प्रदर्शन करता है।
कज़ाखस्तान में रूसी और कज़ाख भाषाओं के बीच कोड-स्विचिंग आम है, फिर भी मशीनी अनुवाद मॉडल के लिए प्रशिक्षण डेटा लगभग न के बराबर है। MWS AI और साझेदार विश्वविद्यालयों के शोधकर्ताओं ने मौजूदा कज़ाख-रूसी समानांतर संग्रह (कानूनी दस्तावेज़, प्रेस विज्ञप्तियाँ) लेकर और SimAlign का उपयोग करके कज़ाख वाक्यों में कृत्रिम रूप से रूसी शब्द सम्मिलित करके एक सिंथेटिक डेटासेट बनाया, जो एम्बेडिंग के माध्यम से संदर्भ के आधार पर प्रतिस्थापन चुनता है। उन्होंने इस सिंथेटिक डेटा पर कई ओपन मॉडल (mBART, M2M100, NLLB-600, NLLB-3.3B) को फाइन-ट्यून किया। हालांकि वाणिज्यिक सिस्टम ने स्वचालित मीट्रिक (BLEU, ChrF++, COMET) पर उच्च स्कोर किया, लेकिन लिकर्ट स्केल का उपयोग करके मानव मूल्यांकन ने दिखाया कि फाइन-ट्यून किए गए NLLB-3.3B मॉडल ने 3.09/5 अंक प्राप्त किए, जो दो वाणिज्यिक एपीआई (2.80 और 3.49) को हराता है। यह दृष्टिकोण कज़ाख में अनुवादित ट्विटर डेटा जोड़ने पर भी प्रदर्शन में सुधार करता है। हालांकि, सिंथेटिक डेटा की स्वाभाविकता केवल 2.62/5 रेट की गई, परीक्षण सेट छोटा है (618 वाक्य), और अन्य भाषा युग्मों में स्थानांतरणीयता अनिश्चित बनी हुई है।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार