Génération de données synthétiques pour la traduction du code-switching mixte russo-kazakh
Meta
Des chercheurs de MWS AI et de plusieurs universités ont développé une méthode pour générer des corpus parallèles synthétiques afin de traduire le code-switching russo-kazakh (mélange de langues). En utilisant le remplacement de mots basé sur SimAlign, ils ont affiné des modèles comme NLLB-3.3B, obtenant un score évalué par des humains de 3,09/5, surpassant les systèmes commerciaux (2,80-3,49) malgré les limitations des données synthétiques.
Le code-switching entre le russe et le kazakh est courant au Kazakhstan, mais il n'existe presque pas de données d'entraînement pour les modèles de traduction automatique. Des chercheurs de MWS AI et d'universités partenaires ont créé un jeu de données synthétique en partant de corpus parallèles kazakh-russe existants (documents juridiques, communiqués de presse) et en insérant artificiellement des mots russes dans des phrases kazakhes à l'aide de SimAlign, qui sélectionne les remplacements en fonction du contexte via des plongements vectoriels. Ils ont affiné plusieurs modèles ouverts (mBART, M2M100, NLLB-600, NLLB-3.3B) sur ces données synthétiques. Bien que les systèmes commerciaux aient obtenu des scores plus élevés sur les métriques automatiques (BLEU, ChrF++, COMET), une évaluation humaine utilisant une échelle de Likert a montré que le modèle NLLB-3.3B affiné atteignait 3,09/5, battant deux API commerciales (2,80 et 3,49). L'approche a également amélioré les performances lors de l'ajout de données Twitter traduites en kazakh. Cependant, les données synthétiques n'ont été notées qu'à 2,62/5 pour le naturel, l'ensemble de test est petit (618 phrases) et la transférabilité à d'autres paires de langues reste incertaine.
Source: Habr — хаб ML —
original
