Übersetzung von gemischtem Russisch und Kasachisch mit synthetischen Daten
Meta
Forscher von MWS AI und mehreren Universitäten haben eine Methode zur Erstellung synthetischer Datensätze entwickelt, um gemischte russisch-kasachische Sprachwechsel zu übersetzen. Ihr Ansatz, der auf SimAlign-Ausrichtung und dem NLLB-3.3B-Modell basiert, übertraf in der menschlichen Bewertung kommerzielle Systeme, obwohl automatische Metriken das Gegenteil zeigen.
In Kasachstan ist die Vermischung von Russisch und Kasachisch in sozialen Medien und im Alltag weit verbreitet, aber bestehende maschinelle Übersetzungssysteme kommen mit diesem Code-Switching aufgrund fehlender Trainingsdaten nur schlecht zurecht. Eine Gruppe von Forschern von MWS AI und Universitäten hat einen eigenen Bewertungskorpus KRCS mit 618 Sätzen erstellt und synthetische Datengenerierung auf Basis vorhandener paralleler Korpora (juristische Dokumente und Pressemitteilungen mit 89.000 beziehungsweise 80.000 Sätzen) angewendet. Für die Erstellung gemischter Phrasen wurden fünf Methoden eingesetzt, von denen sich cs-5 als beste erwies – der Austausch von 15 % der minimal alignierten Einheiten durch russische Wörter unter Verwendung von SimAlign, das den Kontext über Embeddings berücksichtigt. Das Feintuning der Modelle mBART, M2M100, NLLB-600 und NLLB-3.3B auf synthetischen Daten zeigte eine Qualitätssteigerung: Beispielsweise verbesserte mBART den BLEU-Wert von 4,62 auf 12,08. Das größte Modell NLLB-3.3B erreichte nach dem Feintuning 16,48 BLEU, das beste Ergebnis unter den offenen Modellen. Um sich dem realen Sprachstil anzunähern, fügten die Autoren auch ins Kasachische übersetzte russische Tweets zum Training hinzu, was einen leichten Zuwachs brachte. Bei automatischen Metriken (BLEU, ChrF++, COMET) übertreffen kommerzielle Systeme die offenen, aber bei der manuellen Bewertung durch Muttersprachler erzielte das Modell der Autoren 3,09 Punkte auf der Likert-Skala gegenüber 2,80 und 3,49 bei kommerziellen Alternativen. Die Forscher räumen Einschränkungen ein: synthetische Daten haben eine durchschnittliche Natürlichkeit von 2,62 von 5, der Testkorpus ist klein (618 Sätze), und die Übertragbarkeit der Methode auf andere Sprachpaare ist nicht garantiert.
Quelle: Habr — хаб ML —
Original
