ForschungModelle 🇷🇺 24.07.2026 10:01

Wie man gemischtes Russisch-Kasachisch übersetzt und nicht verrückt wird

Forscher von MWS AI und Universitäten schlugen eine Methode zur Erstellung eines synthetischen Datensatzes für die maschinelle Übersetzung von gemischtem russisch-kasachischem Text (Code-Switching) vor. Ihr auf synthetischen Daten trainiertes Modell übertraf kommerzielle Systeme in der menschlichen Bewertung, blieb jedoch hinter ihnen bei automatischen Metriken zurück.
In Kasachstan wird in sozialen Medien und im Alltag oft Kasachisch und Russisch gemischt (Code-Switching), aber es gibt fast keine maschinellen Übersetzungssysteme, die solche gemischten Sätze gut übersetzen können, da es an Daten fehlt. Die Autoren der Studie von MWS AI und mehreren Universitäten sammelten einen Korpus von 618 Sätzen mit Code-Switching zur Evaluierung, aber für das Training reicht das nicht. Also erstellten sie einen synthetischen Datensatz unter Verwendung vorhandener paralleler Korpora (juristische Dokumente und Pressemitteilungen) und der Methode SimAlign, die kasachische Wörter kontextbezogen durch russische ersetzt. Dieser Ansatz (cs-5) erwies sich als effektiver als eine grobe Ersetzung. Auf den synthetischen Daten wurden die Modelle mBART, M2M100, NLLB-600 und NLLB-3.3B nachtrainiert sowie ein Transformer-600 von Grund auf trainiert. Nach automatischen Metriken (BLEU, ChrF++, COMET) übertrafen kommerzielle Übersetzungssysteme alle offenen Modelle. Bei der manuellen Bewertung durch Muttersprachler auf einer Likert-Skala (von 1 bis 5) erreichte das beste Modell der Autoren jedoch 3,09, während die kommerziellen Systeme 2,80 und 3,49 erzielten. Auch das Hinzufügen von ins Kasachische übersetzten russischsprachigen Tweets aus dem Korpus von Rybakova brachte eine leichte Qualitätssteigerung. Die Autoren räumen Einschränkungen ein: Die synthetischen Daten sind nicht ideal (durchschnittliche Natürlichkeitsbewertung 2,62/5), der Testkorpus ist klein (618 Sätze), automatische Metriken stimmen nicht mit der manuellen Bewertung überein, der Vergleich mit kommerziellen APIs ist ungenau (deren Modelle sind unbekannt), und die Übertragbarkeit auf andere Sprachen wurde nicht geprüft.
Quelle: Habr — хаб ML — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten