InvestigaciónModelos 🇷🇺 24.07.2026 10:01

Cómo traducir texto mixto ruso-kazajo y no volverse loco

Investigadores de MWS AI y universidades propusieron un método para generar un conjunto de datos sintéticos para la traducción automática de texto mixto ruso-kazajo (cambio de código). Su modelo, entrenado con datos sintéticos, superó a los sistemas comerciales en la evaluación humana, aunque quedó por detrás de ellos en las métricas automáticas.
En Kazajistán, en las redes sociales y en la vida cotidiana, a menudo se mezclan los idiomas kazajo y ruso (code-switching), pero casi no existen sistemas de traducción automática que traduzcan bien estas frases mixtas debido a la falta de datos. Los autores del estudio, de MWS AI y varias universidades, recopilaron un corpus de 618 oraciones con code-switching para su evaluación, pero esto es insuficiente para el entrenamiento. Por ello, crearon un conjunto de datos sintéticos utilizando corpus paralelos existentes (documentos legales y comunicados de prensa) y el método SimAlign, que reemplaza palabras kazajas por rusas teniendo en cuenta el contexto. Este enfoque (cs-5) resultó más efectivo que un reemplazo simple. Con los datos sintéticos, ajustaron los modelos mBART, M2M100, NLLB-600 y NLLB-3.3B, y también entrenaron desde cero un transformer-600. Según las métricas automáticas (BLEU, ChrF++, COMET), los sistemas de traducción comerciales superaron a todos los modelos abiertos. Sin embargo, en la evaluación manual realizada por hablantes nativos utilizando una escala Likert (del 1 al 5), el mejor modelo de los autores obtuvo 3,09, mientras que los sistemas comerciales recibieron 2,80 y 3,49. Además, la adición de tuits en ruso traducidos al kazajo del corpus de Rybakova proporcionó una pequeña mejora en la calidad. Los autores reconocen limitaciones: los datos sintéticos no son ideales (puntuación media de naturalidad de 2,62/5), el corpus de prueba es pequeño (618 oraciones), las métricas automáticas no coinciden con la evaluación manual, la comparación con las API comerciales no es adecuada (sus modelos son desconocidos) y no se ha comprobado la transferibilidad a otros idiomas.
Fuente: Habr — хаб ML — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas