OnderzoekToepassingen 🇷🇺 26.07.2026 19:05

Hoe vertaal je gemengd Russisch en Kazachs met synthetische data

MetaMeta
Onderzoekers van MWS AI en verschillende universiteiten hebben een methode ontwikkeld voor het genereren van synthetische datasets om gemengd Russisch-Kazachse code-switching te vertalen. Hun aanpak, gebaseerd op SimAlign-uitlijning en het NLLB-3.3B-model, presteerde beter dan commerciële systemen in menselijke evaluatie, hoewel automatische metrieken het tegenovergestelde laten zien.
In Kazachstan is het gebruikelijk om Russisch en Kazachs te mengen in sociale media en dagelijkse gesprekken, maar bestaande machinevertaalsystemen hebben moeite met deze code-switching vanwege een gebrek aan trainingsdata. Een groep onderzoekers van MWS AI en universiteiten heeft een eigen evaluatiecorpus KRCS samengesteld met 618 zinnen en synthetische datageneratie toegepast op basis van bestaande parallelle corpora (juridische documenten en persberichten van respectievelijk 89.000 en 80.000 zinnen). Voor het maken van gemengde zinnen zijn vijf methoden gebruikt, waarvan cs-5 het beste bleek: vervanging van 15% van de minimaal uitgelijnde eenheden door Russische woorden met behulp van SimAlign, dat rekening houdt met context via embeddings. Fijnafstemming van de modellen mBART, M2M100, NLLB-600 en NLLB-3.3B op synthetische data toonde kwaliteitsverbetering: bijvoorbeeld mBART verbeterde BLEU van 4,62 naar 12,08. Het grootste model NLLB-3.3B bereikte 16,48 BLEU na fijnafstemming, het beste resultaat onder open modellen. Om de echte spreekstijl te benaderen voegden de auteurs ook naar het Kazachs vertaalde Russische tweets toe aan de training, wat een kleine verbetering opleverde. Op automatische metrieken (BLEU, ChrF++, COMET) presteren commerciële systemen beter dan open modellen, maar bij handmatige evaluatie door moedertaalsprekers scoorde het model van de auteurs 3,09 op de Likertschaal tegenover 2,80 en 3,49 van commerciële tegenhangers. De onderzoekers erkennen beperkingen: synthetische data hebben een gemiddelde natuurlijkheid van 2,62 uit 5, het testcorpus is klein (618 zinnen), en overdraagbaarheid van de methode naar andere taalparen is niet gegarandeerd.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws