كيفية ترجمة نص مختلط روسي-كازاخستاني دون الجنون
اقترح باحثون من MWS AI والجامعات طريقة لتوليد مجموعة بيانات اصطناعية للترجمة الآلية للنص المختلط الروسي-الكازاخستاني (تبديل الرموز). تفوق نموذجهم، المدرب على البيانات الاصطناعية، على الأنظمة التجارية في التقييم البشري، رغم أنه تخلف عنها في المقاييس التلقائية.
في كازاخستان، غالبًا ما يخلط الناس بين اللغتين الكازاخستانية والروسية في وسائل التواصل الاجتماعي والحياة اليومية (تبديل الرموز)، لكن لا توجد تقريبًا أنظمة ترجمة آلية تترجم هذه العبارات المختلطة جيدًا بسبب نقص البيانات. قام الباحثون من MWS AI والعديد من الجامعات بجمع مجموعة بيانات من 618 جملة تحتوي على تبديل الرموز للتقييم، لكن هذه الكمية غير كافية للتدريب. لذا، أنشأوا مجموعة بيانات اصطناعية باستخدام مجموعات موازية موجودة (وثائق قانونية وبيانات صحفية) وطريقة SimAlign، والتي تستبدل الكلمات الكازاخستانية بكلمات روسية مع مراعاة السياق. أثبت هذا النهج (cs-5) فعاليته أكثر من الاستبدال العشوائي. تم ضبط النماذج mBART وM2M100 وNLLB-600 وNLLB-3.3B على البيانات الاصطناعية، بالإضافة إلى تدريب نموذج transformer-600 من الصفر. وفقًا للمقاييس الآلية (BLEU وChrF++ وCOMET)، تفوقت أنظمة الترجمة التجارية على جميع النماذج مفتوحة المصدر. ومع ذلك، في التقييم اليدوي بواسطة متحدثين أصليين باستخدام مقياس ليكرت (من 1 إلى 5)، حصل أفضل نموذج للباحثين على 3.09، بينما حصلت الأنظمة التجارية على 2.80 و3.49. كما أدت إضافة التغريدات الروسية المترجمة إلى الكازاخستانية من مجموعة Rybakova إلى تحسن طفيف في الجودة. يعترف الباحثون بالقيود: البيانات الاصطناعية غير مثالية (متوسط درجة الطبيعية 2.62/5)، مجموعة الاختبار صغيرة (618 جملة)، المقاييس الآلية لا تتطابق مع التقييم اليدوي، المقارنة مع واجهات برمجة التطبيقات التجارية غير دقيقة (نماذجها غير معروفة)، ولم يتم اختبار قابلية النقل إلى لغات أخرى.
المصدر: Habr — хаб ML —
الأصلي
