How to Translate Mixed Russian and Kazakh Using Synthetic Data
Meta
Researchers from MWS AI and several universities have developed a method for generating synthetic datasets to translate mixed Russian-Kazakh code-switched language. Their approach, based on SimAlign alignment and the NLLB-3.3B model, outperformed commercial systems in human evaluation, although automatic metrics show the opposite.
Di Kazakhstan, percampuran bahasa Rusia dan Kazakh umum terjadi di media sosial dan kehidupan sehari-hari, namun sistem penerjemahan mesin yang ada saat ini kesulitan menangani alih kode (code-switching) ini karena kurangnya data pelatihan. Sekelompok peneliti dari MWS AI dan universitas-universitas mengumpulkan korpus evaluasi KRCS sendiri yang terdiri dari 618 kalimat dan menerapkan pembuatan data sintetis berdasarkan korpus paralel yang ada (dokumen hukum dan siaran pers masing-masing sebanyak 89.000 dan 80.000 kalimat). Untuk membuat frasa campuran, mereka menggunakan lima metode, di mana metode terbaik adalah cs-5 — mengganti 15% unit penyelarasan minimal dengan kata-kata Rusia menggunakan SimAlign yang mempertimbangkan konteks melalui embedding. Penyesuaian (fine-tuning) model mBART, M2M100, NLLB-600, dan NLLB-3.3B pada data sintetis menunjukkan peningkatan kualitas: misalnya, mBART meningkatkan BLEU dari 4,62 menjadi 12,08. Model terbesar, NLLB-3.3B, mencapai BLEU 16,48 setelah penyesuaian, yang merupakan hasil terbaik di antara model terbuka. Untuk mendekati gaya bicara nyata, para penulis juga menambahkan tweet Rusia yang diterjemahkan ke dalam bahasa Kazakh ke dalam pelatihan, yang memberikan sedikit peningkatan. Berdasarkan metrik otomatis (BLEU, ChrF++, COMET), sistem komersial mengungguli sistem terbuka, namun dalam evaluasi manual oleh penutur asli, model penulis mendapat skor 3,09 pada skala Likert, dibandingkan dengan 2,80 dan 3,49 dari sistem komersial. Para peneliti mengakui keterbatasan: data sintetis memiliki kealamian rata-rata 2,62 dari 5, korpus uji kecil (618 kalimat), dan portabilitas metode ke pasangan bahasa lain tidak dijamin.
Sumber: Habr — хаб ML —
asli
