الأبحاث 🇷🇺 26.07.2026 19:05

توليد بيانات اصطناعية للترجمة المتداخلة بين الروسية والكازاخية

MetaMeta
طور باحثون من MWS AI وعدة جامعات طريقة لتوليد مدونات موازية اصطناعية لترجمة التداخل اللغوي بين الروسية والكازاخية (مزيج من اللغات). باستخدام استبدال الكلمات القائم على SimAlign، قاموا بضبط نماذج مثل NLLB-3.3B، محققين درجة تقييم بشري 3.09/5، متفوقين على الأنظمة التجارية (2.80-3.49) رغم قيود البيانات الاصطناعية.
في كازاخستان، يعتبر التبديل اللغوي بين الروسية والكازاخية أمرًا شائعًا، ومع ذلك لا توجد تقريبًا أي بيانات تدريبية لنماذج الترجمة الآلية. أنشأ باحثون من إم دبليو إس إيه آي MWS AI وجامعات شريكة مجموعة بيانات اصطناعية عن طريق أخذ مجموعات متوازية موجودة بين الكازاخية والروسية (وثائق قانونية، بيانات صحفية) وإدراج كلمات روسية بشكل مصطنع في الجمل الكازاخية باستخدام سيما لاين SimAlign، الذي يختار البدائل بناءً على السياق عبر التضمينات embeddings. قاموا بضبط عدة نماذج مفتوحة (إم بارت mBART، إم تو إم مئة M2M100، إن إل إل بي-600 NLLB-600، إن إل إل بي-3.3B NLLB-3.3B) على هذه البيانات الاصطناعية. على الرغم من أن الأنظمة التجارية سجلت درجات أعلى في المقاييس الآلية (بلو BLEU، كر إف بلس ChrF++، كوميت COMET)، أظهر تقييم بشري باستخدام مقياس ليكرت أن نموذج إن إل إل بي-3.3B NLLB-3.3B المعدل حصل على 3.09/5، متفوقًا على واجهتين برمجيتين تجاريتين (2.80 و 3.49). كما أدى النهج إلى تحسين الأداء عند إضافة بيانات تويتر المترجمة إلى الكازاخية. ومع ذلك، فإن البيانات الاصطناعية حصلت فقط على 2.62/5 من حيث الطبيعة، ومجموعة الاختبار صغيرة (618 جملة)، كما أن قابلية النقل إلى أزواج لغوية أخرى لا تزال غير مؤكدة.
المصدر: Habr — хаб ML — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة