Araştırma 🇷🇺 26.07.2026 19:05

Rusça-Kazakça Kod Değiştirme Çevirisi için Sentetik Veri Üretimi

MetaMeta
MWS AI ve çeşitli üniversitelerden araştırmacılar, Rusça-Kazakça kod değiştirmeli (dillerin karışımı) çeviri için sentetik paralel derlem üretmek amacıyla bir yöntem geliştirdi. SimAlign tabanlı kelime değiştirme kullanarak NLLB-3.3B gibi modelleri ince ayarladılar ve insan değerlendirmesinde 3,09/5 puan alarak, sentetik veri sınırlamalarına rağmen ticari sistemleri (2,80-3,49) geride bıraktılar.
Kazakistan'da Rusça ve Kazakça arasında sıkça kod değiştirme yapılmasına rağmen, makine çevirisi modelleri için neredeyse hiç eğitim verisi bulunmamaktadır. MWS AI ve ortak üniversitelerden araştırmacılar, mevcut Kazakça-Rusça paralel derlemlerini (yasal belgeler, basın bültenleri) kullanarak ve SimAlign aracılığıyla Kazakça cümlelere yapay olarak Rusça kelimeler ekleyerek, bağlam temelli vektör temsilleri (embeddings) ile seçim yapmak suretiyle sentetik bir veri kümesi oluşturmuşlardır. Bu sentetik veriler üzerinde çeşitli açık modelleri (mBART, M2M100, NLLB-600, NLLB-3.3B) ince ayar (fine-tuning) yapmışlardır. Ticari sistemler otomatik metriklerde (Bilingual Evaluation Understudy - BLEU, Character n-gram F-score - ChrF++, COMET) daha yüksek puan alsa da, Likert ölçeği kullanılarak yapılan insan değerlendirmesi, ince ayarlı NLLB-3.3B modelinin 3.09/5 puan alarak iki ticari uygulama programlama arayüzünü (Application Programming Interface - API) (2.80 ve 3.49) geride bıraktığını göstermiştir. Yaklaşım ayrıca Kazakçaya çevrilmiş Twitter verileri eklendiğinde performansı artırmıştır. Bununla birlikte, sentetik veriler doğallık açısından yalnızca 2.62/5 puan almış, test seti küçük (618 cümle) olup, diğer dil çiftlerine aktarılabilirlik belirsizliğini korumaktadır.
Kaynak: Habr — хаб ML — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler