如何使用合成数据翻译俄语与哈萨克语混合语言
Meta
来自MWS AI和多所大学的研究人员开发了一种生成合成数据集的方法,用于翻译混合俄语与哈萨克语代码转换语言。他们的方法基于SimAlign对齐和NLLB-3.3B模型,在人工评估中优于商业系统,尽管自动指标显示相反结果。
在哈萨克斯坦,社交网络和日常生活中经常出现俄语和哈萨克语的混合使用,但由于缺乏训练数据,现有的机器翻译系统难以应对这种语码转换。来自MWS AI和多所大学的研究人员收集了包含618个句子的专用评估语料库KRCS,并利用现有的平行语料库(分别为89,000句的法律文件和80,000句的新闻稿)进行合成数据生成。他们采用了五种方法创建混合短语,其中效果最佳的是cs-5方法——通过SimAlign(利用嵌入向量考虑上下文)将15%的最小对齐单元替换为俄语单词。使用合成数据对mBART、M2M100、NLLB-600和NLLB-3.3B模型进行微调后,质量得到提升:例如,mBART的BLEU分数从4.62提升至12.08。最大的模型NLLB-3.3B在微调后达到16.48的BLEU分数,这是开源模型中的最佳结果。为更接近真实语言风格,作者还将翻译成哈萨克语的俄语推文加入训练,取得了小幅提升。在自动评估指标(BLEU、ChrF++、COMET)上,商业系统优于开源模型,但在母语者的人工评估中,作者的模型在李克特量表上获得3.09分,而商业系统分别为2.80和3.49分。研究人员承认存在局限性:合成数据的平均自然度为2.62(满分5分),测试语料库较小(仅618个句子),且该方法是否适用于其他语言对尚不能保证。
来源: Habr — хаб ML —
原文
