Como traduzir texto misto russo-cazaque sem enlouquecer
Pesquisadores da MWS AI e universidades propuseram um método para gerar um conjunto de dados sintético para tradução automática de texto misto russo-cazaque (alternância de código). O modelo deles, treinado em dados sintéticos, superou sistemas comerciais na avaliação humana, embora tenha ficado atrás deles em métricas automáticas.
No Cazaquistão, é comum misturar as línguas cazaque e russa nas redes sociais e na fala cotidiana (code-switching), mas quase não existem sistemas de tradução automática que traduzam bem essas frases misturadas devido à falta de dados. Os autores da pesquisa, da MWS AI e de várias universidades, compilaram um corpus de 618 frases com code-switching para avaliação, mas isso é insuficiente para treinamento. Então, eles criaram um conjunto de dados sintético usando corpora paralelos existentes (documentos jurídicos e comunicados de imprensa) e o método SimAlign, que substitui palavras cazaques por russas levando em conta o contexto. Essa abordagem (cs-5) mostrou-se mais eficaz do que a substituição grosseira. Com os dados sintéticos, eles ajustaram os modelos mBART, M2M100, NLLB-600 e NLLB-3.3B, e também treinaram do zero o transformer-600. Pelas métricas automáticas (BLEU, ChrF++, COMET), os sistemas comerciais de tradução superaram todos os modelos abertos. No entanto, na avaliação manual feita por falantes nativos usando a escala Likert (de 1 a 5), o melhor modelo dos autores obteve 3,09, enquanto os sistemas comerciais alcançaram 2,80 e 3,49. Além disso, a adição de tweets em russo traduzidos para o cazaque do corpus de Rybakova resultou em um pequeno ganho de qualidade. Os autores reconhecem limitações: os dados sintéticos não são ideais (avaliação média de naturalidade de 2,62/5), o corpus de teste é pequeno (618 frases), as métricas automáticas não coincidem com a avaliação manual, a comparação com APIs comerciais é inadequada (seus modelos são desconhecidos) e a transferibilidade para outras línguas não foi testada.
Fonte: Habr — хаб ML —
original
