Generación de datos sintéticos para la traducción de cambio de código mixto ruso-kazajo
Meta
Investigadores de MWS AI y varias universidades desarrollaron un método para generar corpus paralelos sintéticos para la traducción del cambio de código mixto ruso-kazajo (mezcla de idiomas). Utilizando reemplazo de palabras basado en SimAlign, ajustaron modelos como NLLB-3.3B, logrando una puntuación de evaluación humana de 3.09 sobre 5, superando a sistemas comerciales (2.80-3.49) a pesar de las limitaciones de los datos sintéticos.
El cambio de código entre ruso y kazajo es común en Kazajistán, pero apenas existen datos de entrenamiento para modelos de traducción automática. Investigadores de MWS AI y universidades asociadas crearon un conjunto de datos sintéticos partiendo de corpus paralelos existentes en kazajo y ruso (documentos legales, comunicados de prensa) e insertando artificialmente palabras rusas en frases kazajas mediante SimAlign, que selecciona reemplazos según el contexto a través de embeddings. Ajustaron varios modelos abiertos (mBART, M2M100, NLLB-600, NLLB-3.3B) con estos datos sintéticos. Aunque los sistemas comerciales obtuvieron puntuaciones más altas en métricas automáticas (BLEU, ChrF++, COMET), una evaluación humana mediante escala Likert mostró que el modelo NLLB-3.3B ajustado alcanzó 3.09/5, superando a dos APIs comerciales (2.80 y 3.49). El enfoque también mejoró el rendimiento al añadir datos de Twitter traducidos al kazajo. Sin embargo, los datos sintéticos solo obtuvieron una puntuación de 2.62/5 en naturalidad, el conjunto de prueba es pequeño (618 frases) y la transferibilidad a otros pares de lenguas sigue siendo incierta.
Fuente: Habr — хаб ML —
original
