OnderzoekModellen 🇷🇺 24.07.2026 10:01

Hoe vertaal je gemengd Russisch-Kazachs zonder gek te worden

Onderzoekers van MWS AI en universiteiten stelden een methode voor om een synthetische dataset te genereren voor machinevertaling van gemengde Russisch-Kazachse tekst (code-switching). Hun model, getraind op synthetische data, overtrof commerciële systemen in menselijke evaluatie, maar bleef achter bij hen in automatische metrieken.
In Kazachstan worden in sociale media en het dagelijks leven vaak het Kazachs en het Russisch door elkaar gebruikt (code-switching), maar er bestaan bijna geen automatische vertaalsystemen die dergelijke gemengde zinnen goed kunnen vertalen vanwege het gebrek aan gegevens. De onderzoekers van MWS AI en verschillende universiteiten verzamelden een corpus van 618 zinnen met code-switching voor evaluatie, maar dat is te weinig om modellen te trainen. Daarom creëerden ze een synthetische dataset met behulp van bestaande parallelle corpora (juridische documenten en persberichten) en de SimAlign-methode, die Kazachse woorden vervangt door Russische, rekening houdend met de context. Deze aanpak (cs-5) bleek effectiever dan ruwe vervanging. Op de synthetische data werden de modellen mBART, M2M100, NLLB-600 en NLLB-3.3B verder getraind, en daarnaast werd een transformer-600 model helemaal opnieuw getraind. Op basis van automatische metrieken (BLEU, ChrF++, COMET) overtroffen commerciële vertaalsystemen alle open modellen. Bij handmatige evaluatie door moedertaalsprekers op een Likert-schaal (van 1 tot 5) scoorde het beste model van de onderzoekers echter 3,09, terwijl de commerciële systemen 2,80 en 3,49 behaalden. Ook het toevoegen van naar het Kazachs vertaalde Russischtalige tweets uit het corpus van Rybakova leverde een lichte kwaliteitsverbetering op. De onderzoekers erkennen de beperkingen: synthetische gegevens zijn niet perfect (gemiddelde natuurlijkheidsscore van 2,62/5), het testcorpus is klein (618 zinnen), automatische metrieken komen niet overeen met handmatige evaluatie, de vergelijking met commerciële API's is niet correct (hun modellen zijn onbekend), en de overdraagbaarheid naar andere talen is niet getest.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws