研究模型 🇷🇺 24.07.2026 10:01

如何翻译混合俄语-哈萨克语而不抓狂

来自 MWS AI 和大学的研究人员提出了一种生成合成数据集的方法,用于混合俄语-哈萨克语文本(代码转换)的机器翻译。他们的模型在合成数据上训练,在人工评估中优于商业系统,但在自动评估指标上落后于它们。
在哈萨克斯坦的社交媒体和日常生活中,人们经常混合使用哈萨克语和俄语(语码转换),但由于缺乏数据,几乎没有能够很好地翻译这种混合短语的机器翻译系统。来自MWS AI和多所大学的研究人员收集了618个包含语码转换的句子作为评估语料,但这对于训练来说远远不够。于是,他们利用现有的平行语料库(法律文件和新闻稿)以及SimAlign方法创建了一个合成数据集,该方法根据上下文将哈萨克语词汇替换为俄语。这种策略(称为cs-5)比粗暴替换更有效。他们在合成数据上微调了mBART、M2M100、NLLB-600和NLLB-3.3B模型,并从头训练了transformer-600模型。根据自动评估指标(BLEU、ChrF++、COMET),商业翻译系统在所有开源模型之上表现更优。然而,在母语者使用李克特量表(1至5分)进行的人工评估中,作者的最佳模型得分为3.09,而商业系统得分分别为2.80和3.49。此外,加入来自Rybakova语料库的俄语推特的哈萨克语翻译后,质量有小幅提升。作者承认存在局限性:合成数据不完美(自然度平均得分2.62/5),测试语料库很小(618个句子),自动评估指标与人工评估不一致,与商业API的比较不严谨(其模型未知),且未验证对其他语言的迁移性。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻