Menghasilkan Data Sintetis untuk Penerjemahan Campuran Bahasa Rusia-Kazakh
Meta
Peneliti dari MWS AI dan beberapa universitas mengembangkan metode untuk menghasilkan korpora paralel sintetis untuk menerjemahkan campuran bahasa Rusia-Kazakh (campuran bahasa). Menggunakan penggantian kata berbasis SimAlign, mereka menyempurnakan model seperti NLLB-3.3B, mencapai skor evaluasi manusia 3,09/5, melampaui sistem komersial (2,80-3,49) meskipun ada keterbatasan data sintetis.
Percampuran bahasa antara bahasa Rusia dan Kazakh sering terjadi di Kazakhstan, namun hampir tidak ada data pelatihan untuk model penerjemahan mesin. Peneliti dari MWS AI dan universitas mitra menciptakan dataset sintetis dengan mengambil korpora paralel Kazakh-Rusia yang sudah ada (dokumen hukum, siaran pers) dan secara artifisial menyisipkan kata-kata Rusia ke dalam kalimat Kazakh menggunakan SimAlign, yang memilih penggantian berdasarkan konteks melalui penyematan (embeddings). Mereka menyempurnakan (fine-tune) beberapa model terbuka (mBART, M2M100, NLLB-600, NLLB-3.3B) pada data sintetis ini. Meskipun sistem komersial mendapat skor lebih tinggi pada metrik otomatis (BLEU, ChrF++, COMET), evaluasi manusia menggunakan skala Likert menunjukkan model NLLB-3.3B yang telah disempurnakan mencapai 3,09/5, mengalahkan dua API komersial (masing-masing 2,80 dan 3,49). Pendekatan ini juga meningkatkan performa saat menambahkan data Twitter yang diterjemahkan ke bahasa Kazakh. Namun, data sintetis hanya mendapat peringkat 2,62/5 untuk kealamian (naturalness), set pengujiannya kecil (618 kalimat), dan kemampuan transfer ke pasangan bahasa lain masih belum pasti.
Sumber: Habr — хаб ML —
asli
