Forschung 🇷🇺 26.07.2026 19:05

Synthetische Daten für die Übersetzung von gemischt russisch-kasachischem Code-Switching erzeugen

MetaMeta
Forscher von MWS AI und mehreren Universitäten entwickelten eine Methode zur Erzeugung synthetischer Parallelkorpora für die Übersetzung von russisch-kasachischem Code-Switching (Sprachmischung). Mittels SimAlign-basiertem Wortersatz feinabgestimmter Modelle wie NLLB-3.3B erreichten sie eine menschlich bewertete Punktzahl von 3,09/5 und übertrafen damit kommerzielle Systeme (2,80–3,49), troz der Einschränkungen synthetischer Daten.
Code-Switching zwischen Russisch und Kasachisch ist in Kasachstan weit verbreitet, dennoch gibt es fast keine Trainingsdaten für maschinelle Übersetzungsmodelle. Forscher von MWS AI und Partneruniversitäten erstellten einen synthetischen Datensatz, indem sie bestehende kasachisch-russische Parallelkorpora (Rechtsdokumente, Pressemitteilungen) nutzten und mithilfe von SimAlign künstlich russische Wörter in kasachische Sätze einfügten; SimAlign wählt Ersetzungen basierend auf dem Kontext durch Embeddings aus. Sie feintunten mehrere offene Modelle (mBART, M2M100, NLLB-600, NLLB-3.3B) mit diesen synthetischen Daten. Obwohl kommerzielle Systeme bei automatischen Metriken (BLEU, ChrF++, COMET) höhere Werte erzielten, zeigte eine menschliche Bewertung mittels Likert-Skala, dass das feingetunte NLLB-3.3B-Modell 3,09 von 5 Punkten erreichte und damit zwei kommerzielle APIs (2,80 und 3,49) übertraf. Der Ansatz verbesserte auch die Leistung, wenn Twitter-Daten hinzugefügt wurden, die ins Kasachische übersetzt worden waren. Allerdings wurde der synthetische Datensatz hinsichtlich Natürlichkeit nur mit 2,62 von 5 bewertet, der Testsatz ist klein (618 Sätze), und die Übertragbarkeit auf andere Sprachpaare bleibt unsicher.
Quelle: Habr — хаб ML — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten