Genereren van synthetische data voor gemengd Russisch-Kazachs codewisselvertalingen
Meta
Onderzoekers van MWS AI en verschillende universiteiten ontwikkelden een methode om synthetische parallelle corpora te genereren voor het vertalen van Russisch-Kazachse codewisselingen (mengeling van talen). Met behulp van op SimAlign gebaseerde woordvervanging verfijnden ze modellen zoals NLLB-3.3B, wat een door mensen beoordeelde score van 3.09/5 opleverde, beter dan commerciële systemen (2.80-3.49) ondanks de beperkingen van synthetische data.
Code-switching tussen Russisch en Kazachs komt veel voor in Kazachstan, maar er is nauwelijks trainingsdata voor machinale vertaalmodellen. Onderzoekers van MWS AI en partneruniversiteiten hebben een synthetische dataset gecreëerd door bestaande Kazachs-Russische parallelle corpora (juridische documenten, persberichten) te nemen en kunstmatig Russische woorden in Kazachse zinnen in te voegen met behulp van SimAlign, dat op basis van context via embeddings vervangingen selecteert. Ze hebben verschillende open modellen (mBART, M2M100, NLLB-600, NLLB-3.3B) fijngetuned op deze synthetische data. Hoewel commerciële systemen hoger scoorden op geautomatiseerde metrieken (BLEU, ChrF++, COMET), liet een menselijke evaluatie met behulp van een Likert-schaal zien dat het fijngetunde NLLB-3.3B-model een score van 3,09/5 behaalde en daarmee twee commerciële API's (2,80 en 3,49) overtrof. De aanpak verbeterde ook de prestaties bij het toevoegen van Twitterdata die naar het Kazachs was vertaald. De synthetische data scoorden echter slechts 2,62/5 op natuurlijkheid, de testset is klein (618 zinnen) en de overdraagbaarheid naar andere taalparen blijft onzeker.
Bron: Habr — хаб ML —
origineel
