Pesquisa 🇷🇺 26.07.2026 19:05

Geração de Dados Sintéticos para Tradução de Code-Switching Misto Russo-Cazaque

MetaMeta
Pesquisadores da MWS AI e de várias universidades desenvolveram um método para gerar corpora paralelos sintéticos para tradução de code-switching (mistura de línguas) russo-cazaque. Usando substituição de palavras baseada em SimAlign, eles ajustaram modelos como o NLLB-3.3B, alcançando uma pontuação de 3,09/5 em avaliação humana, superando sistemas comerciais (2,80-3,49) apesar das limitações dos dados sintéticos.
Na Cazaquistão, a alternância de código entre russo e cazaque é comum, mas quase não há dados de treinamento para modelos de tradução automática. Pesquisadores da MWS AI e universidades parceiras criaram um conjunto de dados sintéticos a partir de corpora paralelos existentes cazaque-russo (documentos legais, comunicados de imprensa), inserindo artificialmente palavras russas em frases cazaques usando SimAlign, que seleciona substituições com base no contexto via embeddings. Eles ajustaram vários modelos abertos (mBART, M2M100, NLLB-600, NLLB-3.3B) nesses dados sintéticos. Embora os sistemas comerciais tenham obtido pontuações mais altas em métricas automatizadas (BLEU, ChrF++, COMET), uma avaliação humana usando escala Likert mostrou que o modelo NLLB-3.3B ajustado alcançou 3,09/5, superando duas interfaces de programação de aplicações comerciais (2,80 e 3,49). A abordagem também melhorou o desempenho ao adicionar dados do Twitter traduzidos para o cazaque. No entanto, os dados sintéticos foram avaliados apenas com 2,62/5 para naturalidade, o conjunto de teste é pequeno (618 frases) e a transferibilidade para outros pares de idiomas permanece incerta.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas